Portada de Carrera de modelos IA agosto 2026: tracker completo de 11 lanzamientos en 20 días (Anthropic, OpenAI, Google, xAI, Z.ai)
Volver al blog
IA 24 Agosto 2026 13 min lectura 5 visitas

Carrera de modelos IA agosto 2026: tracker completo de 11 lanzamientos en 20 días (Anthropic, OpenAI, Google, xAI, Z.ai)

Chester
Chester Editor

La carrera de modelos IA ha entrado en una fase que roza el absurdo. Entre el 3 y el 21 de agosto de 2026 se anunciaron doce actualizaciones o modelos nuevos de peso frontier: Anthropic afinó pricing de Sonnet 5, OpenAI sacó GPT-5.6-Cyber, Google publicó Gemini 3.7 Flash, xAI lanzó Grok 4.6, Z.ai desdobló GLM-5.3 y GLM-5.2 Turbo, DeepSeek promocionó a GA su V4-Pro, Alibaba disparó Qwen 3.8 Max y ByteDance encadenó Seed 2.1 Turbo, Seedance 2.5, Muse Spark 1.2 y Muse Glimmer. Veinte días. Doce modelos. Ningún benchmark independiente puesto al día en tiempo real.

Este artículo es el tracker completo de esos lanzamientos: fechas, empresa, tipo de modelo, ventana de contexto, precios API por millón de tokens en dólares y benchmark relevante cuando está publicado. Y una lectura editorial sobre quién gana en coding, en razonamiento, en coste y en contexto, más un aviso sobre por qué este ritmo tiene un problema estructural: la capacidad de testar los modelos no crece al mismo paso que la de entrenarlos.

Si vienes buscando el ranking cerrado, esa foto la mantenemos en la guía anual de mejores alternativas a ChatGPT y en la comparativa base de modelos IA 2026. Aquí vamos a lo que ha cambiado en agosto.

Carrera de modelos IA de agosto 2026: tracker con los logos de Anthropic, OpenAI, Google, xAI, Z.ai, DeepSeek, Moonshot y ByteDance en un panel oscuro con acentos morados y turquesas
Doce modelos frontier en 20 días: agosto 2026 rompió el ritmo de publicación de la industria.

Carrera de modelos IA: qué está pasando y por qué en agosto 2026

La carrera de modelos IA agosto 2026 no es una casualidad de calendario. Es la resaca del pulso de julio, cuando OpenAI lanzó la familia GPT-5.6 (Sol, Terra, Luna) el 9 de julio, Anthropic sacó Claude Opus 5 el 24 de julio y Google generalizó Gemini 3.6 Flash el 21 del mismo mes. Cada uno movió pieza y en agosto tocó el turno del segundo nivel: variantes especializadas, actualizaciones post-training, recortes de precio y una tanda de modelos chinos que llevaban semanas en preparación.

El resultado es un mercado en el que ninguna empresa se puede permitir dos semanas sin novedades. Anthropic hizo permanente el precio de introducción de $2/$10 de Sonnet 5 el 10 de agosto para no perder cuota mientras OpenAI recortaba GPT-5.6 Sol un 20% en API el 21 de agosto. Grok 4.6 llegó el 6 de agosto como respuesta directa a esa presión: no es un modelo nuevo, es un post-training sobre Grok 4.5 que sube cinco puntos y aterriza en $2/$6.

Contexto rápido

Agosto 2026 ha visto lanzamientos de siete proveedores distintos: Anthropic, OpenAI, Google, xAI, Z.ai, DeepSeek, Alibaba, Moonshot y ByteDance. La mayoría de las mejoras vienen por afinado, no por reentrenamiento desde cero. El caso claro es Grok 4.6, refresco del 4.5 con nuevo post-training.

Los 12 modelos lanzados: tabla resumen

Esta tabla lista los modelos y actualizaciones anunciados entre el 3 y el 21 de agosto de 2026 según los trackers públicos (Local AI Zone, Digital Applied, aireleasetracker, LLM Gateway). Precios en dólares por millón de tokens (input/output), tamaño de ventana en tokens totales.

FechaModeloCompañíaTipoContexto$ /1M in/out
3 agoQwen 3.8 MaxAlibabaTexto MoE256K1.2 / 6
5 agoMuse Spark 1.2ByteDanceMultimodal128K0.4 / 1.6
6 agoGrok 4.6xAITexto razonador256K2 / 6
8 agoGrok Imagine 2.0xAIImagen-por segundo
8 agoSeedance 2.5ByteDanceVídeo-por segundo
10 agoGPT-5.6-CyberOpenAIEspecializado ciber1.05M5 / 30
10 agoMuse GlimmerByteDanceMultimodal128K0.5 / 2
10 agoSeed 2.1 TurboByteDanceTexto rápido128K0.3 / 1
13 agoGemini 3.7 FlashGoogleTexto multimodal2M0.3 / 1.2
13 agoDeepSeek V4-Pro GADeepSeekTexto MoE abierto256K0.55 / 2.19
14 agoGLM-5.3Z.aiTexto abierto200K0.4 / 1.8
17 agoGLM-5.2 TurboZ.aiTexto rápido200K0.2 / 0.9

Además de estos lanzamientos, Anthropic hizo permanente el precio de $2/$10 de Claude Sonnet 5 el 10 de agosto y OpenAI recortó GPT-5.6 Sol un 20% durante tres meses el 21 de agosto. Sin ser modelos nuevos, mueven la aguja de coste tanto como cualquier release.

Metodología del tracker

Cruzo tres fuentes públicas (Local AI Zone, Digital Applied y aireleasetracker) más las release notes oficiales de cada proveedor. Los precios API están en dólares por millón de tokens porque es la unidad estándar de la industria; no hay conversión a euros porque las tarifas se cobran en $. Las ventanas de contexto son totales, no output máximo. Cuando un benchmark solo aparece en la nota de prensa del propio proveedor lo marco como tal en el texto para no vender cifras interesadas como independientes.

Ganador en coding: SWE-Bench Pro y HumanEval comparados

En coding la carrera de modelos IA de agosto 2026 se decide con SWE-Bench Pro, que sustituyó al viejo SWE-Bench Verified como referencia porque incluye repos privados con tests ocultos. El liderato de agregado sigue siendo Claude Fable 5 en la llm-stats con 80% y Claude Opus 5 aparece dentro del 0,5% de Fable en CursorBench a la mitad de coste. Sonnet 5, aun siendo tier medio, marca 63,2% en SWE-Bench Pro, un salto brutal para un modelo a $2/$10.

En los lanzamientos puros de agosto, GPT-5.6-Cyber empuja el listón en el vertical de ciberseguridad (95% de resolución en problemas del panel Daybreak) pero no es un modelo de coding generalista. Grok 4.6 tiene mejora medible en aggregate score (61 puntos, empate técnico con GPT-5.6 Sol) pero el resultado en SWE-Bench Pro no se ha publicado con revisión independiente todavía. Y DeepSeek V4-Pro sostiene la línea de MiniMax M2.5 con 80,2% en SWE-Bench para reafirmar que el gap con el modelo cerrado se ha cerrado casi por completo en abiertos.

Gráfico de barras comparando SWE-Bench Pro entre Claude Opus 5, Claude Sonnet 5, GPT-5.6 Sol, Gemini 3.7 Flash, Grok 4.6 y DeepSeek V4-Pro en agosto 2026
SWE-Bench Pro agosto 2026: Anthropic sigue arriba, DeepSeek V4-Pro entra en el top 5 como abierto.

Ganador en razonamiento profundo: GPQA Diamond y ARC-AGI

En razonamiento profundo, la métrica que separa modelos serios de modelos de escaparate es GPQA Diamond más ARC-AGI 3. Aquí Claude Opus 5 marca el techo actual: SOTA en Frontier-Bench y triple del segundo mejor en ARC-AGI 3, según Anthropic. GPT-5.6 Sol se sostiene con el slider de esfuerzo activado en xHigh, pero el coste por consulta se dispara. Gemini 3.7 Flash no juega en esta liga porque su rol es coste-eficiencia.

Grok 4.6 aporta su mejora en aggregate (61) que le pone a la altura de GPT-5.6 Sol en las pruebas mixtas, con la ventaja de un precio API sensiblemente menor. GLM-5.3 y Qwen 3.8 Max son los que más terreno han ganado en GPQA Diamond entre los abiertos, con el matiz de que ambos usan mixture of experts y hay que medir latencia real, no solo puntuación bruta. Detalle en la comparativa completa de open source de agosto.

Ganador en coste-eficiencia: dólares por millón de tokens

En coste el podio es transparente. Gemini 3.7 Flash a $0,3/$1,2 con 2M de contexto es el mejor $/token de cualquier modelo frontier cerrado. El único que se le acerca en abiertos es GLM-5.2 Turbo a $0,2/$0,9 pero con la mitad de ventana. Seed 2.1 Turbo de ByteDance a $0,3/$1 juega en el mismo segmento y es especialmente competitivo si tu carga es en Asia.

En el otro extremo, GPT-5.6-Cyber a $5/$30 y Claude Opus 5 a $5/$25 son los flagships premium. GPT-5.6 Sol tras el recorte del 21 de agosto queda en $4/$24 durante tres meses, lo que reabre el debate sobre si merece pagar la prima frente a Sonnet 5 a $2/$10, que ya cubre casi todo el trabajo de volumen. Comparativa detallada con Gemini 3.7 Flash en la ficha de Gemini 3.6/3.7 Flash.

Ganador en contexto: ventanas de 1M+ tokens

La foto de ventana de contexto ha cambiado poco pero el margen se amplía: Gemini 3.7 Flash mantiene 2 millones de tokens, GPT-5.6-Cyber (y toda la familia 5.6) llega a 1,05 millones, Claude Opus 5 y Sonnet 5 comparten 1 millón. Grok 4.6 sigue en 256K, Qwen 3.8 Max y DeepSeek V4-Pro también en 256K, GLM-5.3 en 200K. Muse Spark 1.2, Muse Glimmer y Seed 2.1 Turbo se quedan en 128K.

El detalle que casi nadie subraya: rendimiento útil a contexto largo. Anthropic mide degradación entre 20% y 30% cuando se pasa de 128K a 1M en Sonnet 5 según su propia técnica de needle in a haystack. Gemini 3.7 Flash es el que mejor conserva coherencia por encima de 500K en tests independientes de agosto, gracias al motor de atención jerárquica que Google introdujo en la 3.6.

Modelos chinos que suben: Qwen 3.8 Max, DeepSeek V4-Pro, GLM-5.3

Agosto 2026 confirma que el bloque chino ya no es un asterisco, es un capítulo del ranking. Qwen 3.8 Max abrió el mes con capacidades multimodales avanzadas y un precio agresivo de $1,2/$6. DeepSeek V4-Pro llegó a GA el 13 de agosto tras meses de beta y acabó con la duda: en SWE-Bench compite con los cerrados y su licencia MIT lo hace desplegable en cualquier infraestructura.

Z.ai jugó una doble baza: GLM-5.3 el 14 de agosto para renovar el flagship abierto y GLM-5.2 Turbo el 17 para servir el segmento de coste bajo. Es una estrategia calcada a la de Anthropic con Opus/Sonnet pero en abierto. Contexto histórico y comparativa con Kimi K3 (Moonshot, julio) en la guía de modelos chinos frontier y análisis dedicado a DeepSeek V4 en su ficha propia.

Mapa esquemático de los proveedores chinos de IA en agosto 2026: Alibaba con Qwen, DeepSeek, Z.ai con GLM, Moonshot con Kimi y ByteDance con Seed y Muse, sobre fondo oscuro y acentos cian
El bloque chino se consolida: Qwen, DeepSeek, GLM, Kimi y Seed compiten por el liderato open source.

Modelos open-source que aparecen: DeepSeek V4-Pro, GLM-5.3, Seed 2.1 Turbo

Puramente open source, agosto suma DeepSeek V4-Pro (MIT), GLM-5.3 y GLM-5.2 Turbo (ambos Apache 2.0 en pesos) y las variantes ByteDance Seed 2.1 Turbo, Muse Spark 1.2 y Muse Glimmer, aunque los tres últimos con matices de licencia comercial que conviene revisar. Llama 4 no ha tenido update en agosto pero sigue como pieza clave del ecosistema por Meta AI Studio.

Lo interesante es que la brecha con los cerrados se mide ahora en puntos, no en generaciones. DeepSeek V4-Pro entra al top 5 de SWE-Bench, GLM-5.3 al top 10 de GPQA Diamond y el ranking en Arena Elo del bloque abierto ha subido más de 80 puntos en el año. Si tu criterio es datos on-prem sin llamadas a API externa, hoy tienes opciones frontier reales.

Por qué el ritmo actual no es sostenible: capacidad de testing insuficiente

Este es el aviso del tracker, no un adorno. Un modelo frontier requiere entre dos y seis semanas de evaluación con pruebas independientes serias (SWE-Bench Pro, GPQA Diamond, ARC-AGI, Terminal-Bench 2.1, HELM). Cuando se lanzan doce modelos en veinte días, los benchmarks públicos no llegan y toca fiarse de las cifras que publica el propio proveedor. Anthropic y OpenAI tienen equipos de evaluación internos serios, pero la industria en su conjunto está publicando modelos más rápido de lo que Scale AI, Vals AI o los grupos académicos pueden testar.

Aviso importante: ritmo insostenible

La velocidad de agosto 2026 rompe la capacidad de testing independiente. Muchos modelos entran a los rankings con puntuaciones autoreportadas y sin auditoría de terceros. Si vas a poner uno de estos modelos en producción para un caso crítico (código, salud, legal, atención al cliente que factura) mide contra tu propio dataset dorado antes de conmutar. La tabla de alternativas anual se mantiene solo con benchmarks contrastados; los modelos de agosto entrarán a la revisión de septiembre cuando haya datos independientes.

Cómo elegir modelo desde España en agosto 2026

Desde España, con RGPD, IA Act y coste como tres restricciones, el mapa práctico queda así. Para trabajo de calidad máxima sin mirar el ticket, Claude Opus 5 sigue siendo la elección clara en coding y razonamiento y GPT-5.6 Sol la elección clara en agentes multi-paso y ChatGPT como interfaz. Para el 80% del trabajo diario de programación y escritura, Claude Sonnet 5 a $2/$10 permanente ofrece la mejor relación calidad/precio de la industria en agosto 2026.

Para volumen masivo con exigencia de coste, Gemini 3.7 Flash a $0,3/$1,2 con 2M de contexto es la referencia. Si necesitas modelos on-prem con datos regulados, DeepSeek V4-Pro o GLM-5.3 en tu propio hardware. Y si el caso pide creatividad rápida o comunidad activa, Grok 4.6 mantiene su nicho, con la ficha completa en Grok 4.6 vs 4.5. Para bajar al detalle por caso de uso, la guía de OpenAI 2026 y la comparativa base de modelos IA 2026 siguen siendo la referencia canónica del blog.

Preguntas frecuentes

¿Cuántos modelos IA se lanzaron en agosto de 2026?
Los trackers públicos (Local AI Zone, Digital Applied, LLM Gateway, aireleasetracker) recogen doce lanzamientos o actualizaciones significativas entre el 3 y el 21 de agosto de 2026, más los movimientos de precio de Anthropic (Sonnet 5 permanente a $2/$10 el 10 de agosto) y OpenAI (recorte del 20% en GPT-5.6 Sol el 21 de agosto).

¿Cuál es el mejor modelo para programar en agosto 2026?
Claude Opus 5 y Claude Fable 5 lideran SWE-Bench Pro con 80% en aggregate. Para volumen, Claude Sonnet 5 a $2/$10 ofrece 63,2% en SWE-Bench Pro, la mejor relación calidad/precio del mercado. Los detalles están en la ficha de Claude Opus 5.

¿Cuál es el modelo más barato con calidad frontier?
Gemini 3.7 Flash a $0,3/$1,2 por millón de tokens con 2M de contexto es el más barato entre cerrados frontier. Entre abiertos, GLM-5.2 Turbo a $0,2/$0,9 y Seed 2.1 Turbo a $0,3/$1 pelean el mismo segmento.

¿Qué modelo tiene la ventana de contexto más grande?
Gemini 3.7 Flash mantiene 2 millones de tokens. La familia GPT-5.6 llega a 1,05 millones y Claude Opus 5 y Sonnet 5 comparten 1 millón. Los demás quedan entre 128K y 256K.

¿Los modelos chinos son ya competitivos con los cerrados de EE. UU.?
Sí, en agosto 2026 DeepSeek V4-Pro entra al top 5 de SWE-Bench y GLM-5.3 al top 10 de GPQA Diamond. La brecha se mide en puntos, no en generaciones. Análisis completo en la guía de modelos chinos frontier.

¿Se puede confiar en los benchmarks de agosto 2026?
Parcialmente. La velocidad de lanzamiento supera la capacidad de testing independiente. Muchos números vienen del propio proveedor. Si el caso de uso es crítico, mide contra tu propio dataset antes de conmutar.

¿Merece la pena esperar a septiembre para elegir modelo?
Si tu carga es investigación o crítica, sí: en septiembre habrá datos independientes de SWE-Bench Pro, GPQA y Terminal-Bench sobre los modelos de agosto. Si tu carga es volumen de escritura o coding rutinario, Sonnet 5 y Gemini 3.7 Flash ya cubren el 90% de lo que necesitas.

Aviso de afiliación: este artículo no contiene enlaces de afiliación a productos físicos. Las cifras de precios API son públicas y en dólares por millón de tokens. Las opiniones son del autor sin patrocinio de ningún proveedor de IA.

Compartir:

Comentarios

Cargando comentarios...