Dos dólares de entrada y diez de salida por millón de tokens. Es la cifra que encabeza el lanzamiento de Gemini 4 Argon, anunciado por Google el 30 de septiembre de 2026, y la que menos dice sobre la factura final. Artificial Analysis contabilizó 110M de tokens de salida para completar su evaluación; la mediana de sus comparables se queda en 82M.
Escribo un día después del anuncio, con datos públicos y sin acceso al modelo: hoy solo lo usan los defensores de ciberseguridad del programa Fairwind. Cruzo lo que Google reporta con lo que mide un tercero y cierro con un criterio numérico para decidir si Argon entra en tu presupuesto.
Qué anunció Google y qué deja sin fijar
Koray Kavukcuoglu, SVP de Google DeepMind y Chief AI Architect, firmó el anuncio oficial. Argon se despliega primero a un grupo de «trusted cyber defenders» mediante el Fairwind Program, y a ellos se les ofrece sin guardrails de ciberseguridad. Wiz ya lo usa en su iniciativa Scan for Good para proteger gratis infraestructura pública crítica.
El post promete ampliar el acceso a developers, empresas y consumidores, empezando por clientes de API de pago y suscriptores de Google AI Ultra.
No da fechas.
Tampoco dice cuándo termina el precio introductorio ni qué criterios abren la puerta a Fairwind. Al contrastar el post con las coberturas secundarias esta mañana, ninguna aporta ese dato. Es frustrante que un proveedor publique una tarifa que se duplica sin fecha asociada: así no se cierra el presupuesto de un trimestre (y una fecha de fin debería ser lo mínimo exigible en una ficha de lanzamiento).
Benchmarks: dónde gana Argon y dónde pierde
| Benchmark | Argon | Comparación | Origen |
|---|---|---|---|
| DeepSWE v1.1 | 77.9% | Claude Opus 5.5: 74.2%; GPT-6 Astra: 74.1% | Google (vía Yahoo Finance) |
| AutomationBench | 51.3% | #1 | |
| LVBench | 91.7% | Sin rival publicado en las fuentes revisadas | |
| CWE-bench v1 | 68% | Empate en primer puesto | |
| FrontierSWE v2 | 55.0% | GPT-6 Astra: 65.5% | TBreak |
| Terminal-Bench 4.0 | 57.4% | Claude Opus 5.5: 66.4% | TBreak |
Argon lidera DeepSWE v1.1 por casi 4 puntos sobre Opus 5.5. Pierde 10,5 puntos en FrontierSWE v2 y 9 en Terminal-Bench 4.0. Un modelo que gana una prueba de ingeniería de software y cae en otras dos del mismo campo no es «el mejor en coding»: es el mejor en una definición concreta de coding. TBreak y ExplainX recogen las derrotas que Google no destaca en su post.
La medición independiente es más favorable al conjunto. Artificial Analysis puntúa a Argon (High) con 53 en su Intelligence Index: #8 de 223 modelos, con una mediana de comparables de 26. Queda, eso sí, un asunto de fondo. Las cifras marcadas como Google son del vendor, y Yahoo Finance subraya que no hay verificación independiente de ellas. Para aprender a leer estos marcadores con distancia, revisa nuestro análisis de GPT-5.2 y el benchmark ARC-AGI.
Precio por token no es coste por tarea
Comparar tarifas y dar el asunto por cerrado es la forma más rápida de calcular mal el coste de un LLM.
| Concepto | Introductorio | Tras el periodo introductorio |
|---|---|---|
| Entrada (por 1M) | 2 USD | 4 USD |
| Salida (por 1M) | 10 USD | 20 USD |
La tarifa es solo un factor. El otro es cuántos tokens genera el modelo para resolver cada problema. Artificial Analysis midió 110M de tokens de salida en su evaluación, frente a los 82M de mediana de modelos comparables. Según un cálculo aproximado, eso supone un tercio más de verbosidad, y se paga a la tarifa de salida, la más cara. Los datos son claros: Argon es #8 de 223 en inteligencia y solo #77 de 223 en coste-eficacia. El coste medio por tarea del Intelligence Index es 1.99 USD, pero la fuente no especifica si esa cifra usa el precio introductorio o el de lista, así que no puedo confirmar qué escenario refleja (mi análisis se basa en datos públicos disponibles). Si fuera el introductorio, duplicar la tarifa empujaría esa cifra hacia arriba.
El descuento del 95% en tokens de entrada en caché cambia la ecuación para los sistemas RAG y los agentes con prompts largos y repetidos, donde la entrada domina la factura. Un pipeline así sale mejor parado que un agente que redacta código extenso. Todo depende de la proporción entre entrada cacheada y salida en tu carga.
Acceso restringido y el límite de 1M tokens de salida
¿Puedes usarlo hoy? Salvo que seas un defensor aceptado en Fairwind, no. ExplainX recomienda mantener producción en modelos actuales, como Gemini 3.8 Flash, hasta que exista un endpoint versionado.
El «1M» del anuncio es el límite de tokens de SALIDA, que sube desde 64K. Es una capacidad máxima, no la longitud típica de una respuesta, y tampoco una context window: Artificial Analysis lista aparte 1M de tokens de contexto.
Dos parámetros distintos con la misma cifra.
Ese tope abre migraciones de código o razonamiento extenso en una sola inferencia, y también facturas largas en un modelo ya verboso. Para situar la posición de Google frente a sus rivales, tienes la comparativa Gemini 3 y ChatGPT.
Recomendación práctica con criterios medibles
Mi experiencia analizando herramientas durante la última década me deja una regla: no se compra con el precio de promoción. Estos son los pasos que seguiría, en orden:
- Modela el presupuesto con 4/20 USD, no con 2/10 USD. Si el caso de uso no sale rentable al precio de lista, no lo es.
- Mide los tokens de salida por tarea con tus propios prompts en cuanto tengas acceso, y compáralos con los de tu modelo actual en lugar de fiarte de la mediana de Artificial Analysis.
- Calcula el porcentaje de entrada cacheada en tu carga: a mayor proporción, más pesa el descuento del 95%.
- Espera al endpoint versionado antes de mover producción.
En términos prácticos, Argon compensa solo si su mejora de acierto en tus evaluaciones cubre la duplicación de tarifa y el tercio extra de salida. Si tu carga es de ingeniería de software, incluye Terminal-Bench y FrontierSWE, donde Google no lidera.
Por inteligencia, Argon es un candidato serio; por eficiencia, uno dudoso. Mientras Fairwind siga siendo la única puerta, lo útil es preparar tus propias evaluaciones y presupuestar con la tarifa de lista.




