Esfera de cristal luminosa con reflejos azules y violetas suspendida sobre una superficie oscura con líneas de luz
Volver al blog
IA 5 Octubre 2026 17 min lectura 21 visitas

Gemini 4 Argon: novedades, precio, benchmarks y cuándo podrás usarlo

Chester
Chester Editor

Google ha presentado Gemini 4 Argon, su nuevo modelo de inteligencia artificial de primer nivel, pero casi nadie puede usarlo todavía. Lo anunció el 30 de septiembre Koray Kavukcuoglu, arquitecto jefe de IA de Google DeepMind, con un argumento claro: es un modelo pensado para razonar durante mucho tiempo en tareas largas y complejas, como programar, trabajos legales o financieros y, sobre todo, ciberseguridad. Puede escribir hasta un millón de tokens de respuesta y, en algunas pruebas independientes, se pone primero por delante de los modelos de OpenAI y Anthropic. Pero de momento solo lo tienen un grupo de expertos en ciberdefensa. Te explicamos qué es, cuánto costará, qué dicen los benchmarks, por qué Google lo ha restringido y cuándo podrás probarlo.

En resumen: Gemini 4 Argon es el nuevo modelo de frontera de Google, presentado el 30 de septiembre de 2026. Destaca en programación real, trabajo profesional y ciberseguridad, y puede generar hasta un millón de tokens de salida. Costará 2 dólares por millón de tokens de entrada y 10 de salida durante un periodo de lanzamiento, y después 4 y 20. Lidera el índice independiente de Vals AI (68,9 %), aunque en el de Artificial Analysis queda por detrás de Claude Sonnet 5.5. Ahora mismo solo lo pueden usar los socios de ciberdefensa del programa Fairwind; después llegará a los clientes de pago de la API y a los suscriptores de Google AI Ultra, sin fecha.

Qué es Gemini 4 Argon

Gemini 4 Argon es el primer modelo de la generación Gemini 4 y el más potente que ha creado Google hasta ahora. No es un asistente para el día a día, sino un modelo pensado para trabajos largos: Google lo describe como un modelo «construido para mantener un razonamiento profundo a lo largo de flujos de trabajo complejos y de largo recorrido». En la práctica, eso significa tareas que llevan horas a un agente de IA, como migrar un programa entero a otro lenguaje, auditar un código en busca de vulnerabilidades o preparar un informe financiero a partir de cientos de documentos.

Google lo enfoca en tres terrenos concretos:

  • Ingeniería de software real: no ejercicios cortos, sino proyectos con muchos archivos y cambios que hay que coordinar.
  • Trabajo de conocimiento empresarial: derecho, finanzas e impuestos, donde hay que leer, razonar y redactar con precisión.
  • Ciberdefensa: encontrar, comprobar y corregir fallos de seguridad de forma autónoma.

El nombre sigue la línea que ya vimos en el Google I/O de 2026, donde Google adelantó que la cuarta generación de Gemini se centraría en la IA agéntica, la que no solo responde sino que ejecuta tareas por su cuenta.

Las novedades principales

Un millón de tokens de salida. Es la cifra más llamativa. Los modelos anteriores de Google podían escribir hasta 64.000 tokens en una sola respuesta; Argon llega a un millón. Para hacerse una idea, un millón de tokens son unas 1.500 páginas de texto. No es algo que vayas a necesitar para escribir un correo, pero sí para generar o reescribir un programa grande de una sola vez, o para un agente que trabaja durante horas. GPT-6 Astra, el modelo más avanzado de OpenAI, se queda en 128.000.

Razonamiento sostenido. Argon está entrenado para no «perder el hilo» en tareas largas, uno de los grandes problemas de los agentes de IA actuales, que tienden a desviarse o a olvidar el objetivo tras muchos pasos.

Capacidades de ciberseguridad. Según Google, puede encontrar, validar y parchear vulnerabilidades críticas de software de forma autónoma. Es tan bueno en esto que Google ha decidido empezar a distribuirlo por ahí, con controles, como veremos más abajo.

Comprensión de vídeo largo. En LVBench, una prueba de comprensión de vídeos largos, obtiene un 91,7 %.

Menos alucinaciones. Según recogió Engadget a partir de los datos de Artificial Analysis, Argon tiene una tasa de alucinación del 15 % en su prueba de conocimiento, muy por debajo del 54 % de GPT-6 Astra y GPT-6.1 Sol. Es decir, cuando no sabe algo, se lo inventa mucho menos.

Pantalla grande con líneas de código de colores en un despacho a oscuras iluminado por la luz azul del monitor
Argon está pensado para tareas largas de programación y análisis, no para chatear.

Benchmarks: qué dicen las pruebas

Google ha publicado estos resultados en el anuncio oficial. Son cifras del fabricante, así que conviene leerlas con prudencia:

PruebaQué mideGemini 4 Argon
DeepSWE v1.1Ingeniería de software en proyectos reales77,9 %
AutomationBenchEjecutar procesos de empresa de principio a fin51,3 % (primer puesto)
LVBenchComprensión de vídeos largos91,7 %
CWE-bench v1Corrección de vulnerabilidades68 % (empate en el primer puesto)
Vals IndexFinanzas, programación, derecho e impuestosPrimer puesto

En DeepSWE, la prueba de programación en proyectos reales, Argon saca un 77,9 % frente al 74,1 % de GPT-6 Astra, según los datos comparativos publicados junto al lanzamiento. Varios medios destacan que Argon supera a GPT-6 Astra y a Claude Opus 5.5 en 12 de las 18 pruebas que publicó Google.

En CWE-bench, la prueba de corregir vulnerabilidades, empata en cabeza con GPT-6 Astra y Grok 4.7, lo que da una idea de lo igualada que está la parte alta en ciberseguridad.

Lo que dicen las pruebas independientes

Las cifras del fabricante siempre hay que contrastarlas. Por suerte, dos de los evaluadores independientes más seguidos ya han medido Argon, y no dicen exactamente lo mismo.

Vals AI, que mide tareas profesionales de finanzas, derecho, programación e impuestos, pone a Argon en el primer puesto de 43 modelos, con un 68,9 %. Supera por poco a los modelos de Anthropic, y además con un coste por prueba más bajo:

Vals Index: tareas profesionales

Porcentaje de acierto en finanzas, derecho, programación e impuestos. Más es mejor.

Vals Index: tareas profesionalesPorcentaje de acierto en finanzas, derecho, programación e impuestos. Más es mejor.Gemini 4 ArgonVals Index: 68,9 % — Gemini 4 Argon68,9 %Claude Sonnet 5.5Vals Index: 67,0 % — Claude Sonnet 5.567,0 %Claude Opus 5.5Vals Index: 67,0 % — Claude Opus 5.567,0 %Claude Fable 5.1Vals Index: 65,8 % — Claude Fable 5.165,8 %0 %20 %40 %60 %80 %
Ver los datos en tabla
DatoVals Index
Gemini 4 Argon68,9 %
Claude Sonnet 5.567,0 %
Claude Opus 5.567,0 %
Claude Fable 5.165,8 %
Fuente: Vals AI, octubre de 2026. Coste por prueba: 15,68 $ Argon, 21,34 $ Sonnet 5.5, 32,14 $ Opus 5.5 y 28,71 $ Fable 5.1.

En pruebas concretas de Vals, Argon es primero en Finance Agent (65,4 %), resuelve el 100 % de los problemas de la Olimpiada Internacional de Informática (empatado con GPT-6 Astra), es segundo en Vibe Code Bench (91,9 %) y tercero en LegalBench (88,3 %).

Artificial Analysis, que combina agentes, programación, conocimiento general y razonamiento científico en un índice de inteligencia, es menos entusiasta: le da 53 puntos, por detrás de Claude Sonnet 5.5 (56) y ligeramente por delante de GPT-6.1 Sol (52). Donde sí destaca es en el coste: ejecutar cada tarea de su batería de pruebas le cuesta unos 1,99 dólares, frente a los 7,67 de Sonnet 5.5.

Índice de inteligencia de Artificial Analysis

Puntuación combinada de agentes, programación, conocimiento y ciencia. Más es mejor.

Índice de inteligencia de Artificial AnalysisPuntuación combinada de agentes, programación, conocimiento y ciencia. Más es mejor.0204060Índice: 56 — Claude Sonnet 5.556ClaudeSonnet 5.5Índice: 53 — Gemini 4 Argon53Gemini4 ArgonÍndice: 52 — GPT-6.1 Sol52GPT-6.1 Sol
Ver los datos en tabla
DatoÍndice
Claude Sonnet 5.556
Gemini 4 Argon53
GPT-6.1 Sol52
Fuente: Artificial Analysis, octubre de 2026. Coste medio por tarea: 7,67 $ Sonnet 5.5, 1,99 $ Argon y 0,72 $ GPT-6.1 Sol.

¿Cómo se explica la diferencia? Cada evaluador mide cosas distintas. Vals se centra en tareas profesionales largas, justo donde Google ha puesto el foco; Artificial Analysis pesa también ciencia y conocimiento general. La conclusión razonable es que Argon está en el grupo de cabeza, muy cerca de los mejores modelos de Anthropic y OpenAI, con ventaja clara en precio y en alucinaciones, pero sin una superioridad aplastante. Si te interesa esa comparación entre los rivales, la desarrollamos en Claude Sonnet 5.5 o GPT-6.1 Sol: cuál elegir.

Precio de la API

Google ya ha anunciado el precio para desarrolladores, aunque todavía no se pueda contratar de forma abierta:

ModeloEntrada (por millón de tokens)Salida (por millón de tokens)
Gemini 4 Argon (lanzamiento)2 $10 $
Gemini 4 Argon (después)4 $20 $
Claude Sonnet 5.52 $10 $
GPT-6.1 Sol2 $10 $
Claude Opus 5.54 $20 $
GPT-6 Astra10 $50 $

Precio por millón de tokens de salida

Dólares por millón de tokens generados. Menos es mejor.

Precio por millón de tokens de salidaDólares por millón de tokens generados. Menos es mejor.GPT-6 AstraSalida: 50 $ — GPT-6 Astra50 $Gemini 4 Argon (precio final)Salida: 20 $ — Gemini 4 Argon (precio final)20 $Claude Opus 5.5Salida: 20 $ — Claude Opus 5.520 $Gemini 4 Argon (lanzamiento)Salida: 10 $ — Gemini 4 Argon (lanzamiento)10 $Claude Sonnet 5.5Salida: 10 $ — Claude Sonnet 5.510 $GPT-6.1 SolSalida: 10 $ — GPT-6.1 Sol10 $0 $20 $40 $60 $
Ver los datos en tabla
DatoSalida
GPT-6 Astra50 $
Gemini 4 Argon (precio final)20 $
Claude Opus 5.520 $
Gemini 4 Argon (lanzamiento)10 $
Claude Sonnet 5.510 $
GPT-6.1 Sol10 $
Fuente: Google, Anthropic y OpenAI. Google no ha dicho cuánto durará el precio de lanzamiento de Argon.

Los tokens de entrada que se reutilizan desde la caché tendrán un 95 % de descuento. Google no ha dicho cuánto durará el precio de lanzamiento. Lo relevante es la comparación con GPT-6 Astra, su rival directo: incluso con el precio definitivo, Argon cuesta cinco veces menos en entrada y dos veces y media menos en salida. Engadget resumía que iguala a GPT-6 Astra en el índice de Artificial Analysis «al 60 % del coste».

Ojo con una cosa: el precio por token no lo es todo. Un modelo que razona mucho gasta más tokens por tarea. En las pruebas de Artificial Analysis, Argon generó 110 millones de tokens para completar el índice, una cifra alta. Su coste por tarea sigue siendo competitivo, pero si lo usas para trabajos largos, la factura dependerá de cuánto «piense».

Quién puede usarlo y cuándo

Aquí está la gran pega. Hoy, Gemini 4 Argon no está en la app de Gemini ni en la API abierta. Google lo está distribuyendo por fases:

  1. Ahora: socios de ciberdefensa de confianza, dentro del programa Fairwind, y el proceso voluntario de acceso previo del Gobierno de Estados Unidos.
  2. Después: clientes de pago de la API de Gemini y suscriptores de Google AI Ultra, el plan más caro de Google.
  3. Más adelante: el resto de desarrolladores, empresas y usuarios.

Google no ha dado fechas para ninguna de las fases siguientes, ni ha publicado todavía el identificador del modelo en la API. Tampoco hay información específica para España o Europa: cuando llegue a la API y a AI Ultra, lo normal es que esté disponible aquí igual que el resto de modelos Gemini, pero de momento es una suposición.

Mientras tanto, en la app de Gemini sigues usando los modelos actuales de Google, que no cambian con este anuncio.

Sala de control en penumbra con varias pantallas que muestran gráficos de red y un candado digital luminoso
Argon empieza su despliegue entre equipos de ciberdefensa, antes que en la app de Gemini.

Por qué empieza por la ciberseguridad

La razón es la misma que lleva meses marcando el sector: los modelos más avanzados ya son capaces de encontrar fallos de seguridad mejor que muchos expertos, y eso sirve tanto para defender como para atacar. Google ha optado por dar ventaja primero a los defensores.

El programa Fairwind reúne a socios verificados de ciberdefensa. A ellos Google les da Argon «sin las barreras de ciberseguridad» que tendrá la versión pública, para que puedan usar toda su capacidad en tareas defensivas: buscar vulnerabilidades en su propio software o en código abierto ampliamente usado y corregirlas antes de que alguien las explote. Como ejemplo, Google cita a Wiz, que con su iniciativa Scan for Good encontró con Argon una vulnerabilidad crítica en un software sanitario que los modelos anteriores no habían detectado.

No es una estrategia exclusiva de Google. En septiembre, Google, Anthropic y OpenAI presentaron modelos y programas de acceso orientados a la ciberseguridad, en una especie de carrera para que las defensas vayan por delante. También lo hemos visto en las pausas que OpenAI ha aplicado a algunos de sus modelos por motivos de seguridad, como contamos al hablar de cómo OpenAI frenó GPT-6.1 Astra.

Cómo lo usa Google por dentro

Google asegura que Argon ya está «cambiando la forma de trabajar» de la propia compañía, y da algunos ejemplos concretos:

  • Infraestructura: liberó 300 TiB de memoria en sus centros de datos, y Google calcula que el ahorro total podría estar entre 500 TiB y 1 PiB.
  • Migraciones de código: trabajó sobre más de 800.000 líneas del núcleo Zircon de Fuchsia, el sistema operativo experimental de Google.
  • Optimización: en libgav1, una biblioteca de vídeo, consiguió una mejora de velocidad de 2,7 veces respecto a una versión en Rust.
  • Computación cuántica: mejoró en un 40 % la optimización de recursos frente a la referencia de partida.

Son ejemplos internos y no se pueden comprobar desde fuera, pero ilustran el tipo de trabajo para el que está pensado: tareas técnicas largas donde el modelo actúa casi como un ingeniero más.

Seguridad y riesgos

Un modelo capaz de encontrar vulnerabilidades por su cuenta plantea riesgos evidentes. Google dice haber trabajado en cuatro frentes:

  • Uso indebido: el modelo está diseñado para rechazar peticiones dañinas sin bloquear la investigación legítima de doble uso, y ha pasado pruebas de equipos rojos internos y externos.
  • Inyección de instrucciones: según Google, lidera la prueba de inyección indirecta de Gray Swan, que mide si un agente se deja engañar por instrucciones escondidas en webs o documentos.
  • Desalineación: un sistema vigila el razonamiento y las acciones del modelo, con protocolos de respuesta ante incidentes.
  • Entornos aislados: el entrenamiento de las capacidades de más riesgo se hace en entornos sellados.

Todo esto son compromisos de la propia Google. Las evaluaciones externas irán llegando a medida que más gente tenga acceso.

Frente a Claude y GPT

¿Dónde queda Argon en el panorama actual? Resumiendo lo que dicen las pruebas:

  • Frente a Claude Opus 5.5 y Sonnet 5.5: en tareas profesionales (Vals) Argon va ligeramente por delante y es más barato por tarea; en el índice general de Artificial Analysis, los modelos de Anthropic siguen arriba.
  • Frente a GPT-6 Astra: rendimiento similar o superior en la mayoría de pruebas, mucho más barato y con ocho veces más capacidad de salida.
  • Frente a GPT-6.1 Sol: Argon puntúa algo más alto en Artificial Analysis, pero Sol es más barato por tarea en esas pruebas.

La conclusión: no hay un ganador absoluto. Google vuelve a estar en el grupo de cabeza, algo que no estaba tan claro hace unos meses, y compite sobre todo en precio y fiabilidad. Para elegir entre los asistentes que sí puedes usar hoy, tienes nuestra guía de las mejores alternativas a ChatGPT.

Qué hacer mientras tanto

  • Si eres usuario de la app de Gemini: no tienes que hacer nada. Cuando Argon llegue, lo hará primero a Google AI Ultra; no merece la pena contratar el plan más caro solo para esperar a un modelo sin fecha.
  • Si eres desarrollador: sigue con el modelo que uses ahora. Cuando Google publique el identificador de Argon en la API, merecerá la pena probarlo en tareas largas de programación y documentos, que es donde promete más, comparando el coste real por tarea.
  • Si trabajas en ciberseguridad: el programa Fairwind está pensado para organizaciones de defensa verificadas; si tu empresa encaja, es la única vía de acceso hoy.

Y si prefieres IA en tu propio equipo

Argon es un modelo en la nube y solo se usará a través de Google. Si te interesa tener IA sin depender de nadie, la alternativa son los modelos abiertos que funcionan en tu propio ordenador, que cada vez se acercan más. Lo explicamos en nuestra guía de IA local con Ollama. Para eso, lo que más importa es la memoria de la tarjeta gráfica o la memoria unificada del equipo:

Ver la ASUS TUF GeForce RTX 5090 de 32 GB en Amazon

La RTX 5090, con 32 GB de memoria, es la tarjeta de consumo que permite mover los modelos abiertos más grandes con soltura. Si buscas algo más compacto y silencioso, un Mac mini con mucha memoria unificada es una opción muy eficiente:

Ver el Mac mini con chip M4 y 24 GB en Amazon

Y para modelos realmente grandes, el superordenador de escritorio de NVIDIA, con 128 GB de memoria unificada, del que hicimos un análisis completo:

Ver el NVIDIA DGX Spark en Amazon

Ver el ASUS Ascent GX10 con NVIDIA GB10 en Amazon

Si trabajas muchas horas con agentes de IA, también compensa un buen puesto de trabajo. Un monitor grande y un teclado cómodo se notan en sesiones largas:

Ver el pack Logitech MX Keys Mini y MX Anywhere 3S en Amazon

Ver el SSD WD_BLACK SN7100 de 1 TB en Amazon

El SSD rápido no es un capricho: los modelos locales pesan decenas de gigas y cargarlos desde un disco lento se nota cada vez que los abres. Más opciones en nuestra guía de las mejores GPU para IA local.

Preguntas frecuentes

¿Qué es Gemini 4 Argon?

Es el nuevo modelo de IA de frontera de Google, el primero de la generación Gemini 4. Está pensado para tareas largas y complejas: programación, trabajo legal y financiero y ciberseguridad.

¿Cuándo salió Gemini 4 Argon?

Google lo anunció el 30 de septiembre de 2026, pero solo para socios de ciberdefensa del programa Fairwind.

¿Puedo usar Gemini 4 Argon en la app de Gemini?

Todavía no. Llegará primero a los clientes de pago de la API y a los suscriptores de Google AI Ultra, y después al resto. Google no ha dado fechas.

¿Cuánto cuesta la API de Gemini 4 Argon?

2 dólares por millón de tokens de entrada y 10 de salida durante el periodo de lanzamiento, y después 4 y 20. La entrada en caché tiene un 95 % de descuento.

¿Es mejor Gemini 4 Argon que Claude o GPT?

Depende de la prueba. Lidera el índice de Vals AI en tareas profesionales y supera a GPT-6 Astra en la mayoría de pruebas de Google, pero en el índice de Artificial Analysis queda por detrás de Claude Sonnet 5.5. Destaca en precio y en pocas alucinaciones.

¿Cuántos tokens puede escribir Gemini 4 Argon?

Hasta un millón de tokens de salida en una respuesta, frente a los 64.000 de los modelos anteriores de Google y los 128.000 de GPT-6 Astra.

¿Qué es el programa Fairwind?

Es el programa de Google para socios de ciberdefensa verificados, que reciben Argon sin las restricciones de ciberseguridad para encontrar y corregir vulnerabilidades antes que los atacantes.

¿Llegará Gemini 4 Argon a España?

Google no ha dado información por países. Lo previsible es que llegue con la API de Gemini y Google AI Ultra, que ya están disponibles en España, pero no hay fecha.

Lecturas relacionadas

Este artículo contiene enlaces afiliados a Amazon con el tag arkaiacorp-21. Si compras a través de estos enlaces, Arkaia puede recibir una comisión sin coste adicional para ti. Nuestra valoración editorial es independiente y no varía según los ingresos por afiliación.

Compartir:

Comentarios

Cargando comentarios...