IA4 MIN

Gemini 4 Argon supera a Fable 5.1 y GPT-6 Astra en Vals, con acceso limitado

Google estrena su nueva generación con un modelo para tareas largas. Sus primeros usuarios son equipos de ciberdefensa seleccionados, y las pruebas de programación muestran resultados desiguales.

Gráfico propio de ValsIndex con Argon 68,90, Fable 5.1 65,83 y Astra 63,13, y barras de un error estándar
Imagen: INSERT FUTURE · original graphic. Data: Vals AI, 30 Sep 2026. Error bars: ±1 standard error.

Google ha presentado Gemini 4 Argon, el primer modelo de su nueva generación, y hay una prueba independiente que explica el interés. Vals lo coloca primero en su índice de tareas profesionales, por delante de Claude Fable 5.1 y GPT-6 Astra. El lanzamiento del 30 de septiembre comienza, sin embargo, con equipos de ciberdefensa seleccionados. No es una actualización que cualquier usuario pueda abrir ya en Gemini.

Argon está pensado para encadenar pasos en tareas de trabajo, como modificar código y comprobar el resultado con herramientas. Esa capacidad permite que una IA avance más allá de redactar una respuesta, aunque acertar en una colección de ejercicios no garantiza que resuelva cualquier encargo real.

01

Qué mide la ventaja en Vals

El índice de Vals combina pruebas de programación, finanzas, derecho y fiscalidad, con pesos vinculados al tamaño de los sectores en la economía estadounidense. Argon obtiene 68,90 puntos, frente a 65,83 de Fable 5.1 y 63,13 de GPT-6 Astra. Es una puntuación compuesta, no el porcentaje de empleos que el modelo puede sustituir.

Vals afirma que evaluó Argon el 30 de septiembre. Ese resultado aporta una referencia externa a Google, pero la posición cambia al mirar las tareas por separado. En la misma ficha, Argon figura quinto en la prueba jurídica de Harvey y segundo en VibeCode. Encabezar el índice no equivale a ganar cada categoría.

Las pequeñas barras de la portada muestran el error estándar que publica Vals, una medida de incertidumbre de las puntuaciones estimadas. No son una prueba estadística directa de la diferencia entre cada pareja de modelos.

02

En programación no gana todas las pruebas

La tabla de Google recoge un 77,9 % para Argon en DeepSWE v1.1, frente al 74,1 % de Astra y el 67,4 % de Fable 5.1. DeepSWE pide cambios concretos en proyectos de código abierto y ejecuta pruebas para comprobar que funcionan sin romper comportamientos anteriores. Importan tanto el modelo como las herramientas y las instrucciones con las que se le deja trabajar.

En FrontierSWE v2, otra evaluación de trabajo sobre código, el orden cambia. Argon obtiene un 55,0 %, Astra un 65,5 % y Fable un 56,3 %. Para quien sigue los lanzamientos de GPT-6 Astra y Fable 5.1, estos resultados describen un rival competitivo, no una razón suficiente para cambiar de herramienta sin probar el trabajo que necesita hacer.

Tampoco todas las columnas proceden de un único experimento. La metodología de Google combina pruebas propias, clasificaciones públicas y resultados declarados por otros proveedores. En DeepSWE, Google calculó el dato de Argon, tomó el de Astra de la clasificación pública y el de Fable de su documentación técnica. Se buscan ajustes altos de razonamiento, pero eso no convierte automáticamente cada ejecución en idéntica.

Hay además una comparación que necesita especial cuidado. En AutomationBench, que comprueba si una IA completa tareas usando aplicaciones de una empresa simulada, el 31,4 % atribuido a Fable 5.1 incluye ayuda de Opus 5. Zapier explica que 260 de los 657 encargos pasaron a Opus después de que Fable los rechazara. Contraponer ese resultado al 51,3 % anunciado para Argon como si fueran dos modelos trabajando solos sería engañoso.

Gráfico propio con Argon por delante de Astra y Fable en DeepSWE, pero por detrás de ambos en FrontierSWE v2
Imagen: INSERT FUTURE · original graphic. Data: Google DeepMind, 30 Sep 2026. Different evaluation runs and settings.
03

Quién puede usar Argon y cuánto costará

El acceso inicial pasa por Fairwind, el programa de Google que selecciona organizaciones para trabajos defensivos de ciberseguridad. Google dice que después abrirá Argon a desarrolladores, empresas y consumidores, empezando por clientes de la API de pago y suscriptores de Google AI Ultra. El anuncio no da fecha para esa apertura ni confirma acceso general en España.

La API es la conexión con la que otras aplicaciones envían tareas al modelo y reciben sus respuestas. Google anuncia una tarifa inicial de 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida. Los tokens son fragmentos de texto que el sistema procesa o genera, no un número fijo de palabras. Acabada la promoción, las tarifas subirán a 4 y 20 dólares, sin una duración anunciada para el periodo inicial. No son el precio de una suscripción a Gemini ni una tarifa en euros para España.

Google también anuncia que el máximo de salida pasa de 64.000 a un millón de tokens. Ese límite permite respuestas más largas, pero no describe por sí solo cuánto material puede recibir el modelo ni asegura que una respuesta extensa sea correcta. Para el público general, sigue pendiente la fecha de acceso.

Esquema propio del acceso seleccionado Fairwind, apertura futura sin fecha y tarifas API anunciadas de 2 y 10 dólares, después 4 y 20
Imagen: INSERT FUTURE · original graphic. Source: Google announcement, 30 Sep 2026. Announced future API rates, not subscription prices.
00

La conversación empieza aquí

Accede con una cuenta de apoyo para comentar. Entrar

Todavía no ha comentado nadie. ¿Estrenas tú?

SIGUE LEYENDO

También te puede interesar

PORTADA