Google ha presentado Gemini 4 Argon, el primer modelo de su nueva generación, y hay una prueba independiente que explica el interés. Vals lo coloca primero en su índice de tareas profesionales, por delante de Claude Fable 5.1 y GPT-6 Astra. El lanzamiento del 30 de septiembre comienza, sin embargo, con equipos de ciberdefensa seleccionados. No es una actualización que cualquier usuario pueda abrir ya en Gemini.
Argon está pensado para encadenar pasos en tareas de trabajo, como modificar código y comprobar el resultado con herramientas. Esa capacidad permite que una IA avance más allá de redactar una respuesta, aunque acertar en una colección de ejercicios no garantiza que resuelva cualquier encargo real.
Qué mide la ventaja en Vals
El índice de Vals combina pruebas de programación, finanzas, derecho y fiscalidad, con pesos vinculados al tamaño de los sectores en la economía estadounidense. Argon obtiene 68,90 puntos, frente a 65,83 de Fable 5.1 y 63,13 de GPT-6 Astra. Es una puntuación compuesta, no el porcentaje de empleos que el modelo puede sustituir.
Vals afirma que evaluó Argon el 30 de septiembre. Ese resultado aporta una referencia externa a Google, pero la posición cambia al mirar las tareas por separado. En la misma ficha, Argon figura quinto en la prueba jurídica de Harvey y segundo en VibeCode. Encabezar el índice no equivale a ganar cada categoría.
Las pequeñas barras de la portada muestran el error estándar que publica Vals, una medida de incertidumbre de las puntuaciones estimadas. No son una prueba estadística directa de la diferencia entre cada pareja de modelos.
En programación no gana todas las pruebas
La tabla de Google recoge un 77,9 % para Argon en DeepSWE v1.1, frente al 74,1 % de Astra y el 67,4 % de Fable 5.1. DeepSWE pide cambios concretos en proyectos de código abierto y ejecuta pruebas para comprobar que funcionan sin romper comportamientos anteriores. Importan tanto el modelo como las herramientas y las instrucciones con las que se le deja trabajar.
En FrontierSWE v2, otra evaluación de trabajo sobre código, el orden cambia. Argon obtiene un 55,0 %, Astra un 65,5 % y Fable un 56,3 %. Para quien sigue los lanzamientos de GPT-6 Astra y Fable 5.1, estos resultados describen un rival competitivo, no una razón suficiente para cambiar de herramienta sin probar el trabajo que necesita hacer.
Tampoco todas las columnas proceden de un único experimento. La metodología de Google combina pruebas propias, clasificaciones públicas y resultados declarados por otros proveedores. En DeepSWE, Google calculó el dato de Argon, tomó el de Astra de la clasificación pública y el de Fable de su documentación técnica. Se buscan ajustes altos de razonamiento, pero eso no convierte automáticamente cada ejecución en idéntica.
Hay además una comparación que necesita especial cuidado. En AutomationBench, que comprueba si una IA completa tareas usando aplicaciones de una empresa simulada, el 31,4 % atribuido a Fable 5.1 incluye ayuda de Opus 5. Zapier explica que 260 de los 657 encargos pasaron a Opus después de que Fable los rechazara. Contraponer ese resultado al 51,3 % anunciado para Argon como si fueran dos modelos trabajando solos sería engañoso.

Quién puede usar Argon y cuánto costará
El acceso inicial pasa por Fairwind, el programa de Google que selecciona organizaciones para trabajos defensivos de ciberseguridad. Google dice que después abrirá Argon a desarrolladores, empresas y consumidores, empezando por clientes de la API de pago y suscriptores de Google AI Ultra. El anuncio no da fecha para esa apertura ni confirma acceso general en España.
La API es la conexión con la que otras aplicaciones envían tareas al modelo y reciben sus respuestas. Google anuncia una tarifa inicial de 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida. Los tokens son fragmentos de texto que el sistema procesa o genera, no un número fijo de palabras. Acabada la promoción, las tarifas subirán a 4 y 20 dólares, sin una duración anunciada para el periodo inicial. No son el precio de una suscripción a Gemini ni una tarifa en euros para España.
Google también anuncia que el máximo de salida pasa de 64.000 a un millón de tokens. Ese límite permite respuestas más largas, pero no describe por sí solo cuánto material puede recibir el modelo ni asegura que una respuesta extensa sea correcta. Para el público general, sigue pendiente la fecha de acceso.

La conversación empieza aquí
Accede con una cuenta de apoyo para comentar. Entrar




Todavía no ha comentado nadie. ¿Estrenas tú?