La carrera de modelos IA ha entrado en una fase que roza el absurdo. Entre el 3 y el 21 de agosto de 2026 se anunciaron doce actualizaciones o modelos nuevos de peso frontier: Anthropic afinó pricing de Sonnet 5, OpenAI sacó GPT-5.6-Cyber, Google publicó Gemini 3.7 Flash, xAI lanzó Grok 4.6, Z.ai desdobló GLM-5.3 y GLM-5.2 Turbo, DeepSeek promocionó a GA su V4-Pro, Alibaba disparó Qwen 3.8 Max y ByteDance encadenó Seed 2.1 Turbo, Seedance 2.5, Muse Spark 1.2 y Muse Glimmer. Veinte días. Doce modelos. Ningún benchmark independiente puesto al día en tiempo real.
Este artículo es el tracker completo de esos lanzamientos: fechas, empresa, tipo de modelo, ventana de contexto, precios API por millón de tokens en dólares y benchmark relevante cuando está publicado. Y una lectura editorial sobre quién gana en coding, en razonamiento, en coste y en contexto, más un aviso sobre por qué este ritmo tiene un problema estructural: la capacidad de testar los modelos no crece al mismo paso que la de entrenarlos.
Si vienes buscando el ranking cerrado, esa foto la mantenemos en la guía anual de mejores alternativas a ChatGPT y en la comparativa base de modelos IA 2026. Aquí vamos a lo que ha cambiado en agosto.

Carrera de modelos IA: qué está pasando y por qué en agosto 2026
La carrera de modelos IA agosto 2026 no es una casualidad de calendario. Es la resaca del pulso de julio, cuando OpenAI lanzó la familia GPT-5.6 (Sol, Terra, Luna) el 9 de julio, Anthropic sacó Claude Opus 5 el 24 de julio y Google generalizó Gemini 3.6 Flash el 21 del mismo mes. Cada uno movió pieza y en agosto tocó el turno del segundo nivel: variantes especializadas, actualizaciones post-training, recortes de precio y una tanda de modelos chinos que llevaban semanas en preparación.
El resultado es un mercado en el que ninguna empresa se puede permitir dos semanas sin novedades. Anthropic hizo permanente el precio de introducción de $2/$10 de Sonnet 5 el 10 de agosto para no perder cuota mientras OpenAI recortaba GPT-5.6 Sol un 20% en API el 21 de agosto. Grok 4.6 llegó el 6 de agosto como respuesta directa a esa presión: no es un modelo nuevo, es un post-training sobre Grok 4.5 que sube cinco puntos y aterriza en $2/$6.
Agosto 2026 ha visto lanzamientos de siete proveedores distintos: Anthropic, OpenAI, Google, xAI, Z.ai, DeepSeek, Alibaba, Moonshot y ByteDance. La mayoría de las mejoras vienen por afinado, no por reentrenamiento desde cero. El caso claro es Grok 4.6, refresco del 4.5 con nuevo post-training.
Los 12 modelos lanzados: tabla resumen
Esta tabla lista los modelos y actualizaciones anunciados entre el 3 y el 21 de agosto de 2026 según los trackers públicos (Local AI Zone, Digital Applied, aireleasetracker, LLM Gateway). Precios en dólares por millón de tokens (input/output), tamaño de ventana en tokens totales.
| Fecha | Modelo | Compañía | Tipo | Contexto | $ /1M in/out |
|---|---|---|---|---|---|
| 3 ago | Qwen 3.8 Max | Alibaba | Texto MoE | 256K | 1.2 / 6 |
| 5 ago | Muse Spark 1.2 | ByteDance | Multimodal | 128K | 0.4 / 1.6 |
| 6 ago | Grok 4.6 | xAI | Texto razonador | 256K | 2 / 6 |
| 8 ago | Grok Imagine 2.0 | xAI | Imagen | - | por segundo |
| 8 ago | Seedance 2.5 | ByteDance | Vídeo | - | por segundo |
| 10 ago | GPT-5.6-Cyber | OpenAI | Especializado ciber | 1.05M | 5 / 30 |
| 10 ago | Muse Glimmer | ByteDance | Multimodal | 128K | 0.5 / 2 |
| 10 ago | Seed 2.1 Turbo | ByteDance | Texto rápido | 128K | 0.3 / 1 |
| 13 ago | Gemini 3.7 Flash | Texto multimodal | 2M | 0.3 / 1.2 | |
| 13 ago | DeepSeek V4-Pro GA | DeepSeek | Texto MoE abierto | 256K | 0.55 / 2.19 |
| 14 ago | GLM-5.3 | Z.ai | Texto abierto | 200K | 0.4 / 1.8 |
| 17 ago | GLM-5.2 Turbo | Z.ai | Texto rápido | 200K | 0.2 / 0.9 |
Además de estos lanzamientos, Anthropic hizo permanente el precio de $2/$10 de Claude Sonnet 5 el 10 de agosto y OpenAI recortó GPT-5.6 Sol un 20% durante tres meses el 21 de agosto. Sin ser modelos nuevos, mueven la aguja de coste tanto como cualquier release.
Cruzo tres fuentes públicas (Local AI Zone, Digital Applied y aireleasetracker) más las release notes oficiales de cada proveedor. Los precios API están en dólares por millón de tokens porque es la unidad estándar de la industria; no hay conversión a euros porque las tarifas se cobran en $. Las ventanas de contexto son totales, no output máximo. Cuando un benchmark solo aparece en la nota de prensa del propio proveedor lo marco como tal en el texto para no vender cifras interesadas como independientes.
Ganador en coding: SWE-Bench Pro y HumanEval comparados
En coding la carrera de modelos IA de agosto 2026 se decide con SWE-Bench Pro, que sustituyó al viejo SWE-Bench Verified como referencia porque incluye repos privados con tests ocultos. El liderato de agregado sigue siendo Claude Fable 5 en la llm-stats con 80% y Claude Opus 5 aparece dentro del 0,5% de Fable en CursorBench a la mitad de coste. Sonnet 5, aun siendo tier medio, marca 63,2% en SWE-Bench Pro, un salto brutal para un modelo a $2/$10.
En los lanzamientos puros de agosto, GPT-5.6-Cyber empuja el listón en el vertical de ciberseguridad (95% de resolución en problemas del panel Daybreak) pero no es un modelo de coding generalista. Grok 4.6 tiene mejora medible en aggregate score (61 puntos, empate técnico con GPT-5.6 Sol) pero el resultado en SWE-Bench Pro no se ha publicado con revisión independiente todavía. Y DeepSeek V4-Pro sostiene la línea de MiniMax M2.5 con 80,2% en SWE-Bench para reafirmar que el gap con el modelo cerrado se ha cerrado casi por completo en abiertos.

Ganador en razonamiento profundo: GPQA Diamond y ARC-AGI
En razonamiento profundo, la métrica que separa modelos serios de modelos de escaparate es GPQA Diamond más ARC-AGI 3. Aquí Claude Opus 5 marca el techo actual: SOTA en Frontier-Bench y triple del segundo mejor en ARC-AGI 3, según Anthropic. GPT-5.6 Sol se sostiene con el slider de esfuerzo activado en xHigh, pero el coste por consulta se dispara. Gemini 3.7 Flash no juega en esta liga porque su rol es coste-eficiencia.
Grok 4.6 aporta su mejora en aggregate (61) que le pone a la altura de GPT-5.6 Sol en las pruebas mixtas, con la ventaja de un precio API sensiblemente menor. GLM-5.3 y Qwen 3.8 Max son los que más terreno han ganado en GPQA Diamond entre los abiertos, con el matiz de que ambos usan mixture of experts y hay que medir latencia real, no solo puntuación bruta. Detalle en la comparativa completa de open source de agosto.
Ganador en coste-eficiencia: dólares por millón de tokens
En coste el podio es transparente. Gemini 3.7 Flash a $0,3/$1,2 con 2M de contexto es el mejor $/token de cualquier modelo frontier cerrado. El único que se le acerca en abiertos es GLM-5.2 Turbo a $0,2/$0,9 pero con la mitad de ventana. Seed 2.1 Turbo de ByteDance a $0,3/$1 juega en el mismo segmento y es especialmente competitivo si tu carga es en Asia.
En el otro extremo, GPT-5.6-Cyber a $5/$30 y Claude Opus 5 a $5/$25 son los flagships premium. GPT-5.6 Sol tras el recorte del 21 de agosto queda en $4/$24 durante tres meses, lo que reabre el debate sobre si merece pagar la prima frente a Sonnet 5 a $2/$10, que ya cubre casi todo el trabajo de volumen. Comparativa detallada con Gemini 3.7 Flash en la ficha de Gemini 3.6/3.7 Flash.
Ganador en contexto: ventanas de 1M+ tokens
La foto de ventana de contexto ha cambiado poco pero el margen se amplía: Gemini 3.7 Flash mantiene 2 millones de tokens, GPT-5.6-Cyber (y toda la familia 5.6) llega a 1,05 millones, Claude Opus 5 y Sonnet 5 comparten 1 millón. Grok 4.6 sigue en 256K, Qwen 3.8 Max y DeepSeek V4-Pro también en 256K, GLM-5.3 en 200K. Muse Spark 1.2, Muse Glimmer y Seed 2.1 Turbo se quedan en 128K.
El detalle que casi nadie subraya: rendimiento útil a contexto largo. Anthropic mide degradación entre 20% y 30% cuando se pasa de 128K a 1M en Sonnet 5 según su propia técnica de needle in a haystack. Gemini 3.7 Flash es el que mejor conserva coherencia por encima de 500K en tests independientes de agosto, gracias al motor de atención jerárquica que Google introdujo en la 3.6.
Modelos chinos que suben: Qwen 3.8 Max, DeepSeek V4-Pro, GLM-5.3
Agosto 2026 confirma que el bloque chino ya no es un asterisco, es un capítulo del ranking. Qwen 3.8 Max abrió el mes con capacidades multimodales avanzadas y un precio agresivo de $1,2/$6. DeepSeek V4-Pro llegó a GA el 13 de agosto tras meses de beta y acabó con la duda: en SWE-Bench compite con los cerrados y su licencia MIT lo hace desplegable en cualquier infraestructura.
Z.ai jugó una doble baza: GLM-5.3 el 14 de agosto para renovar el flagship abierto y GLM-5.2 Turbo el 17 para servir el segmento de coste bajo. Es una estrategia calcada a la de Anthropic con Opus/Sonnet pero en abierto. Contexto histórico y comparativa con Kimi K3 (Moonshot, julio) en la guía de modelos chinos frontier y análisis dedicado a DeepSeek V4 en su ficha propia.

Modelos open-source que aparecen: DeepSeek V4-Pro, GLM-5.3, Seed 2.1 Turbo
Puramente open source, agosto suma DeepSeek V4-Pro (MIT), GLM-5.3 y GLM-5.2 Turbo (ambos Apache 2.0 en pesos) y las variantes ByteDance Seed 2.1 Turbo, Muse Spark 1.2 y Muse Glimmer, aunque los tres últimos con matices de licencia comercial que conviene revisar. Llama 4 no ha tenido update en agosto pero sigue como pieza clave del ecosistema por Meta AI Studio.
Lo interesante es que la brecha con los cerrados se mide ahora en puntos, no en generaciones. DeepSeek V4-Pro entra al top 5 de SWE-Bench, GLM-5.3 al top 10 de GPQA Diamond y el ranking en Arena Elo del bloque abierto ha subido más de 80 puntos en el año. Si tu criterio es datos on-prem sin llamadas a API externa, hoy tienes opciones frontier reales.
Por qué el ritmo actual no es sostenible: capacidad de testing insuficiente
Este es el aviso del tracker, no un adorno. Un modelo frontier requiere entre dos y seis semanas de evaluación con pruebas independientes serias (SWE-Bench Pro, GPQA Diamond, ARC-AGI, Terminal-Bench 2.1, HELM). Cuando se lanzan doce modelos en veinte días, los benchmarks públicos no llegan y toca fiarse de las cifras que publica el propio proveedor. Anthropic y OpenAI tienen equipos de evaluación internos serios, pero la industria en su conjunto está publicando modelos más rápido de lo que Scale AI, Vals AI o los grupos académicos pueden testar.
La velocidad de agosto 2026 rompe la capacidad de testing independiente. Muchos modelos entran a los rankings con puntuaciones autoreportadas y sin auditoría de terceros. Si vas a poner uno de estos modelos en producción para un caso crítico (código, salud, legal, atención al cliente que factura) mide contra tu propio dataset dorado antes de conmutar. La tabla de alternativas anual se mantiene solo con benchmarks contrastados; los modelos de agosto entrarán a la revisión de septiembre cuando haya datos independientes.
Cómo elegir modelo desde España en agosto 2026
Desde España, con RGPD, IA Act y coste como tres restricciones, el mapa práctico queda así. Para trabajo de calidad máxima sin mirar el ticket, Claude Opus 5 sigue siendo la elección clara en coding y razonamiento y GPT-5.6 Sol la elección clara en agentes multi-paso y ChatGPT como interfaz. Para el 80% del trabajo diario de programación y escritura, Claude Sonnet 5 a $2/$10 permanente ofrece la mejor relación calidad/precio de la industria en agosto 2026.
Para volumen masivo con exigencia de coste, Gemini 3.7 Flash a $0,3/$1,2 con 2M de contexto es la referencia. Si necesitas modelos on-prem con datos regulados, DeepSeek V4-Pro o GLM-5.3 en tu propio hardware. Y si el caso pide creatividad rápida o comunidad activa, Grok 4.6 mantiene su nicho, con la ficha completa en Grok 4.6 vs 4.5. Para bajar al detalle por caso de uso, la guía de OpenAI 2026 y la comparativa base de modelos IA 2026 siguen siendo la referencia canónica del blog.
Preguntas frecuentes
¿Cuántos modelos IA se lanzaron en agosto de 2026?
Los trackers públicos (Local AI Zone, Digital Applied, LLM Gateway, aireleasetracker) recogen doce lanzamientos o actualizaciones significativas entre el 3 y el 21 de agosto de 2026, más los movimientos de precio de Anthropic (Sonnet 5 permanente a $2/$10 el 10 de agosto) y OpenAI (recorte del 20% en GPT-5.6 Sol el 21 de agosto).
¿Cuál es el mejor modelo para programar en agosto 2026?
Claude Opus 5 y Claude Fable 5 lideran SWE-Bench Pro con 80% en aggregate. Para volumen, Claude Sonnet 5 a $2/$10 ofrece 63,2% en SWE-Bench Pro, la mejor relación calidad/precio del mercado. Los detalles están en la ficha de Claude Opus 5.
¿Cuál es el modelo más barato con calidad frontier?
Gemini 3.7 Flash a $0,3/$1,2 por millón de tokens con 2M de contexto es el más barato entre cerrados frontier. Entre abiertos, GLM-5.2 Turbo a $0,2/$0,9 y Seed 2.1 Turbo a $0,3/$1 pelean el mismo segmento.
¿Qué modelo tiene la ventana de contexto más grande?
Gemini 3.7 Flash mantiene 2 millones de tokens. La familia GPT-5.6 llega a 1,05 millones y Claude Opus 5 y Sonnet 5 comparten 1 millón. Los demás quedan entre 128K y 256K.
¿Los modelos chinos son ya competitivos con los cerrados de EE. UU.?
Sí, en agosto 2026 DeepSeek V4-Pro entra al top 5 de SWE-Bench y GLM-5.3 al top 10 de GPQA Diamond. La brecha se mide en puntos, no en generaciones. Análisis completo en la guía de modelos chinos frontier.
¿Se puede confiar en los benchmarks de agosto 2026?
Parcialmente. La velocidad de lanzamiento supera la capacidad de testing independiente. Muchos números vienen del propio proveedor. Si el caso de uso es crítico, mide contra tu propio dataset antes de conmutar.
¿Merece la pena esperar a septiembre para elegir modelo?
Si tu carga es investigación o crítica, sí: en septiembre habrá datos independientes de SWE-Bench Pro, GPQA y Terminal-Bench sobre los modelos de agosto. Si tu carga es volumen de escritura o coding rutinario, Sonnet 5 y Gemini 3.7 Flash ya cubren el 90% de lo que necesitas.
Aviso de afiliación: este artículo no contiene enlaces de afiliación a productos físicos. Las cifras de precios API son públicas y en dólares por millón de tokens. Las opiniones son del autor sin patrocinio de ningún proveedor de IA.
Comentarios
Inicia sesion para dejar un comentario
Acceder