Gemini 4 Argon de Google lidera en trabajo de conocimiento pero limita el acceso a la programación
Google lanzó Gemini 4 Argon, un nuevo modelo insignia que supera a sus rivales en tareas de conocimiento y razonamiento con contexto extenso, aunque los resultados en programación varían y su disponibilidad sigue siendo restringida.
Traducido automáticamente del original en inglés.
Google ha presentado oficialmente Gemini 4 Argon, su último modelo insignia de inteligencia artificial, posicionándolo como una alternativa superior a las ofertas actuales de OpenAI y Anthropic. Anunciado el 30 de septiembre de 2026, el modelo demuestra ventajas significativas en el trabajo de conocimiento y el procesamiento de contextos largos, aunque su rendimiento en pruebas de referencia de programación es inconsistente. El acceso al sistema está limitado actualmente a un grupo selecto de probadores y socios gubernamentales mientras Google navega por una estrategia de despliegue gradual.
Qué ocurrió
El lanzamiento marca un cambio en la reciente cronología de IA de Google, reemplazando efectivamente el plan previamente anunciado para Gemini 3.5 Pro con esta iteración más avanzada. Aunque la compañía tenía inicialmente la intención de lanzar un nuevo modelo Pro en junio de 2026, optó por desplegar una serie de modelos Flash antes de llegar a Argon. El anuncio sigue a una reunión entre el CEO de Google, Sundar Pichai, y el presidente Donald Trump, donde Pichai se unió a líderes de Anthropic, Meta, Nvidia, OpenAI y SpaceX para firmar un compromiso voluntario de autorregular el desarrollo de la IA. Este acuerdo carece de mecanismos formales de aplicación, pero señala una mayor coordinación industrial en estándares de seguridad.
Gemini 4 Argon logra puntuaciones máximas o empatadas en 13 de 18 pruebas de referencia cuando se compara con GPT-6 Astra de OpenAI y Claude Opus 5.5 y Fable 5.1 de Anthropic. El modelo muestra una fortaleza particular en tareas que implican síntesis compleja de información y automatización. Por ejemplo, obtiene un 51,3% en AutomationBench de Zapier, casi nueve puntos por encima de Claude Opus 5.5. En contextos legales, Argon alcanza un 19,6% en Legal Agent Benchmark de Harvey, lo que es casi el triple de la puntuación de Claude Fable 5.1, aunque esto aún indica que completa plenamente solo aproximadamente una de cada cinco tareas.
A pesar de estos logros, el modelo queda por detrás de los competidores en áreas técnicas específicas. En la prueba de referencia de programación FrontierSWE v2, Argon obtiene un 55,0%, quedando 10,5 puntos por debajo de GPT-6 Astra y nueve puntos por debajo de Claude Opus 5.5. También ocupa el último lugar en Terminal-Bench 4.0 entre los modelos comparados. Estos resultados mixtos sugieren que, si bien Argon está optimizado para el conocimiento general y los flujos de trabajo agénticos, puede que aún no sea la elección definitiva para todas las tareas de ingeniería de software. Google planea recopilar comentarios de los primeros probadores en su Fairwind Program antes de expandir el acceso a clientes de API de pago y suscriptores de AI Ultra.
Cómo funciona
Una característica distintiva de Gemini 4 Argon es su capacidad ampliada de salida. Mientras que un millón de tokens de entrada se ha convertido en el estándar para los modelos de frontera, Argon puede generar hasta un millón de tokens de salida en una sola respuesta. Los modelos Gemini anteriores estaban limitados a 64.000 tokens de salida. Este aumento permite al modelo involucrarse en procesos de razonamiento más profundos, generando cientos de miles de tokens para resolver problemas complejos en una sola trayectoria sin dividirlos en pasos más pequeños.
El modelo también incorpora entrenamiento especializado para aplicaciones de ciberseguridad. Google entrenó a Argon para identificar, validar y parchear vulnerabilidades de software de manera autónoma. Para los participantes del Fairwind Program y equipos internos, el modelo se libera sin ciertas salvaguardas cibernéticas para facilitar este trabajo. Wiz, una firma de seguridad adquirida por Google por $32 mil millones en marzo de 2026, ya está utilizando Argon en su iniciativa Scan for Good. En esta capacidad, el modelo supuestamente descubrió una vulnerabilidad crítica en software de atención médica utilizado globalmente, que los modelos de frontera anteriores no habían detectado.
Detalles clave
- Gemini 4 Argon obtiene un 68,9% en el Vals Index para trabajo de conocimiento, superando a GPT-6 Astra (63,1%) y Claude Opus 5.5 (67,0%).
- El modelo admite hasta un millón de tokens de salida, un aumento significativo respecto al límite de 64.000 tokens en versiones anteriores.
- El precio introductorio se establece en $2 por millón de tokens de entrada y $10 por millón de tokens de salida, aumentando a $4 y $20 respectivamente más adelante.
- Argon logra un 84,2% en la prueba de referencia GraphWalks para entradas entre 256K y 1M tokens, superando a GPT-6 Astra por más de 12 puntos.
- En pruebas de ciberseguridad, Argon obtiene un 85,8% en la prueba interna de descubrimiento de vulnerabilidades de Google y un 70,9% en la prueba de pentesting de Wiz.
- El acceso está restringido actualmente al Fairwind Program y socios del gobierno de EE. UU., con una disponibilidad más amplia prevista para fechas posteriores.
Por qué importa
Para desarrolladores y fundadores técnicos, el rendimiento mixto en programación de Gemini 4 Argon sugiere que la selección de modelos debe seguir siendo específica para cada tarea. Si bien la alta puntuación en DeepSWE v1.1 (77,9%) indica capacidades sólidas en ciertos flujos de trabajo de ingeniería de software, las puntuaciones más bajas en FrontierSWE v2 y Terminal-Bench 4.0 implican que puede no reemplazar a los modelos de programación especializados para todos los casos de uso. Los equipos que construyen flujos de trabajo agénticos para trabajo de conocimiento, análisis legal o automatización probablemente encontrarán valor inmediato, pero aquellos centrados puramente en la generación de código deben continuar evaluando alternativas como GPT-6 Astra o Claude Opus 5.5.
La expansión de los tokens de salida a un millón cambia cómo los ingenieros pueden diseñar prompts y bucles de agentes. En lugar de encadenar múltiples llamadas a la API para mantener el contexto o desglosar grandes tareas, los desarrolladores pueden potencialmente depender de una sola pasada de generación larga. Esto podría simplificar la arquitectura para tareas de razonamiento complejo, pero puede aumentar la latencia y el costo por solicitud. La estructura de precios introductoria ofrece una ventaja temporal de costos, pero el aumento de precio previsto a $20 por millón de tokens de salida lo alinea con competidores premium, requiriendo un modelado cuidadoso de costos para aplicaciones de producción.
Qué puedes hacer
- Evalúa tus flujos de trabajo actuales para identificar tareas que se beneficien del razonamiento con contexto largo en lugar de la generación rápida de código.
- Solicita acceso al Fairwind Program si tu organización califica para oportunidades de prueba tempranas.
- Compara tus agentes existentes con las puntuaciones reportadas en AutomationBench y Vals Index para estimar posibles ganancias de rendimiento.
- Revisa tus patrones de uso de tokens para prepararte para el cambio hacia límites de salida más altos y los costos asociados.
- Monitorea el calendario de despliegue para clientes de API de pago y suscriptores de AI Ultra para planificar los plazos de integración.
- Considera las implicaciones de seguridad de usar modelos sin salvaguardas cibernéticas si participas en programas de investigación de vulnerabilidades.

