Los mejores modelos de IA open source de agosto 2026 ya no juegan a alcanzar al frontier propietario: lo están rebasando en varias verticales. Kimi K3 de Moonshot lidera el ranking de OpenRouter, GLM-5.2 de Zhipu bate a GPT-5.5 en SWE-bench Pro a un sexto del coste, y LongCat-2.0 de Meituan es el primer modelo de 1,6 billones de parámetros entrenado íntegramente en chips chinos. Esta comparativa desgrana los diez modelos abiertos que importan hoy, sus benchmarks reales, sus precios de API y su hardware mínimo para probarlos en casa.
El open source alcanza (y en algunas verticales supera) al frontier cerrado
Hace dieciocho meses los modelos abiertos iban dos generaciones por detrás de GPT y Claude. En agosto de 2026 ese debate ya no existe: Kimi K3 encabeza Arena en código frontend por encima de Claude Fable 5, GLM-5.2 supera a GPT-5.5 en SWE-bench Pro con 62,1 frente a 58,6, y DeepSeek V4 Pro rinde como Claude Sonnet 4 por menos de un dólar por millón de tokens.
Lo interesante es el ritmo: cada dos semanas aparece un modelo abierto que redefine el listón. Meituan liberó LongCat-2.0 el 30 de junio, Moonshot publicó Kimi K3 el 27 de julio y Zhipu movió GLM-5.2 a producción el 13 de junio, todo conviviendo con Llama 4 Scout y Maverick de Meta. Si te llevó a nuestra guía de las mejores herramientas de IA gratis 2026, esta comparativa es su complemento natural.
Metodología: qué es open source real y qué es weights-only
Antes de entrar en modelos conviene aclarar un matiz. La comunidad usa la etiqueta open source para tres cosas diferentes:
- Open source estricto: pesos, código de entrenamiento, datos y receta publicados con licencia permisiva. Ejemplos históricos: OLMo, Pythia. Casi nadie a nivel frontier lo hace.
- Open weights permissive: pesos publicados con licencia MIT o Apache 2.0, sin restricciones comerciales. LongCat-2.0 (MIT), Mistral Medium 3.5, Gemma 3 (Gemma Terms) y GLM-5.2 (MIT) entran aquí.
- Open weights con licencia restringida: pesos publicados pero con condiciones. Llama 4 tiene la Llama Community License (restricción para plataformas con más de 700 millones de usuarios). Qwen usa Qwen License. Kimi K3 y DeepSeek V4 publican pesos con condiciones sobre usos permitidos.
En este artículo llamamos open source a las tres categorías porque, en la práctica, cualquiera puede descargar los pesos y usarlos en producción para el 99 % de los proyectos.
Tabla comparativa: los 10 modelos open que importan en agosto 2026
| Modelo | Laboratorio | Parámetros | Contexto | Licencia | Fortaleza |
|---|---|---|---|---|---|
| Kimi K3 | Moonshot AI | 2,8T (16/896 exp.) | 1M | Modificada | All-rounder |
| GLM-5.2 | Zhipu AI | 744B (40B activos) | 1M | MIT | Coding y agentes |
| DeepSeek V4 Pro | DeepSeek | Densamente MoE | 128K | MIT | Coste/calidad |
| DeepSeek V4 Flash | DeepSeek | MoE ligero | 128K | MIT | Low-cost hosted |
| Llama 4 Scout | Meta | 17B/109B (16 exp.) | 10M | Llama Community | Contexto extremo |
| Llama 4 Maverick | Meta | 17B/400B (128 exp.) | 1M | Llama Community | Multimodal top |
| Qwen 3.7 Max | Alibaba | 1T aprox. | 1M | Cerrado | Multilingüe y español |
| Mistral Medium 3.5 | Mistral AI | 128B densa | 262K | Apache 2.0 | Velocidad |
| LongCat-2.0 | Meituan | 1,6T (48B activos) | 1M | MIT | Agentes MIT puro |
| Gemma 3 27B | 27B densa | 128K | Gemma Terms | Consumer VRAM |
Nota importante sobre Qwen: Alibaba movió su línea Max a producto cerrado, pero mantiene abierta toda la familia Qwen3 (7B, 14B, 32B, 72B, 235B). Cuando hablamos de la fortaleza de Qwen en español nos referimos tanto a Max como a los abiertos de la familia, que heredan el mismo tokenizer multilingüe.
Kimi K3 (Moonshot AI): el nuevo lider all-rounder
Kimi K3 es la joya de Moonshot y hoy el modelo abierto más capaz de propósito general. Cifras: 2,8 billones de parámetros totales, arquitectura Stable LatentMoE con 16 expertos activos de 896, ventana de 1 millón de tokens y multimodalidad nativa. Pesos publicados el 27 de julio de 2026. Contexto ampliado en Kimi K3 y Qwen 3.8 Max: modelos chinos frontier open source.
En benchmarks Kimi K3 se coloca segundo en el Arena de Frontend Code con 1.679 puntos, por encima de Claude Fable 5 en pruebas ciegas con desarrolladores. En Program Bench y SWE Marathon supera a GPT-5.6 Sol. Su puntuación global en el Intelligence Index de Artificial Analysis es de 80,2 sobre 100, situándose en el puesto 5 de 217 modelos evaluados. En agosto entra en el top 3 absoluto por primera vez para un modelo con pesos abiertos.
El precio del API oficial de Moonshot es de 3 dólares por millón de tokens de entrada y 15 de salida, con caché a 0,30 dólares. Está disponible también en OpenRouter, Fireworks y Together AI a precios equivalentes. Para inferencia local necesitas al menos ocho GPUs H100 de 80 GB con cuantización FP8; no es un modelo para casa, salvo que quieras montar una pequeña granja.
Casos de uso ideales: asistente técnico all-rounder, código frontend y agentes multimodales. Debilidades: coste alto frente a DeepSeek y degradación por encima de 512K tokens efectivos.
GLM-5.2 (Zhipu AI): el rey del coding con licencia MIT
Si tu trabajo es programar, GLM-5.2 es hoy la mejor opción abierta. Zhipu lo liberó el 13 de junio de 2026 con licencia MIT verdaderamente permisiva y en dos meses se ha convertido en el modelo por defecto de las plataformas de coding agents chinas. Detalles en Z.ai GLM-5.2, el modelo chino barato que compite con Claude Fable y GPT-5.6.
Ficha técnica: Mixture-of-Experts con 744.000 millones de parámetros totales y 40.000 millones activos por token, ventana de 1 millón de tokens, licencia MIT. Benchmarks: SWE-bench Pro 62,1 (bate a GPT-5.5 con 58,6 y a su predecesor GLM-5.1 con 58,4), FrontierSWE 74,4 (por encima de GPT-5.5 y a un punto de Claude Opus 4.8), MCP-Atlas 77,0 (empatado con Opus 4.8) y Terminal-Bench 2.1 con 81,0.
Lo demoledor es el coste. Con GLM-5.2 puedes conseguir el rendimiento de GPT-5.5 por aproximadamente un sexto del precio a través de Z.ai directamente. Para agencias, freelances y arranques que no quieren depender de Anthropic u OpenAI, GLM-5.2 es la elección racional en agosto de 2026. En local necesitas dos H100 con cuantización Q4, o un Mac Studio M3 Ultra con 192 GB de memoria unificada para inferencia lenta pero funcional.
Casos de uso: agentes de coding largo horizonte, refactorización de repositorios, MCP y revisiones de pull request. Es el mejor asistente open source para desarrollo software.
DeepSeek V4 Flash y V4 Pro: la mejor relación coste-calidad
DeepSeek ha jugado siempre en la liga del low-cost frontier, y V4 mantiene la tradición. La familia se compone de dos modelos: V4 Flash (rápido, sin razonamiento profundo) y V4 Pro (razonamiento avanzado, contexto ampliado). Ambos con pesos abiertos bajo licencia MIT y disponibles vía API oficial además de en OpenRouter y Fireworks.
Precios: DeepSeek V4 Pro a 0,435 dólares por millón de tokens de entrada y 0,87 de salida (cache-hit 0,003625). DeepSeek V4 Flash a 0,14 y 0,28 respectivamente (cache-hit 0,0028). Con estas cifras DeepSeek es aproximadamente 34 veces más barato que Claude Opus 4.7 en entrada y 86 veces más barato en salida. El 16 de agosto de 2026 entra en vigor una nueva tabla con tarifas peak y off-peak que ajusta ligeramente al alza los picos de día.
Benchmarks: V4 Flash puntuá 29,3 en el Intelligence Index de Artificial Analysis, 71,6 en GPQA Diamond, 82,7 en Terminal-Bench 2.1 y 54,4 en DeepSWE. Incluye soporte nativo para Responses API y adaptación Codex, lo que facilita migraciones desde OpenAI. V4 Pro rivaliza directamente con GPT-4o y Claude Sonnet en las mismas evaluaciones al 3 % del coste.
Caso de uso claro: proyectos con alto volumen y margen ajustado. Chatbots verticales, RAG masivo, procesamiento por lotes, SaaS.
Llama 4 Scout y Maverick (Meta): el ecosistema más maduro
Meta liberó Llama 4 en dos versiones que cubren extremos distintos del espectro. Llama 4 Scout es un MoE de 17.000 millones de parámetros activos y 109.000 millones totales con 16 expertos, ventana de 10 millones de tokens (récord del mercado) y capacidad para caber en una sola H100 con cuantización int4 aplicada al vuelo. Llama 4 Maverick comparte los 17.000 millones activos pero escala a 128 expertos y 400.000 millones totales, con 1 millón de contexto y pesos disponibles en BF16 y FP8 quantizado.
En capacidades multimodales Llama 4 Maverick supera a GPT-4o y Gemini 2.0 Flash en la mayoría de benchmarks multimodales, y rivaliza con DeepSeek-V3 en razonamiento y código pese a tener un tamaño total mucho menor. Idiomas soportados nativamente: árabe, inglés, francés, alemán, hindi, indonesio, italiano, portugués, español, tagalo, tailandés y vietnamita. Buen soporte de español, aunque por debajo de Qwen.
Si quieres levantar Llama 4 Scout en tu propio equipo, tenemos guía paso a paso en Tutorial Llama 4 Scout y Maverick en Ollama local: hardware paso a paso. Spoiler: con una GPU de 24 GB de VRAM y cuantización Q4_K_M puedes ejecutar Scout de forma decente, y con un mini PC con 64 GB de RAM DDR5 puedes probar Maverick a velocidad de lectura humana usando descarga por capas.
La Llama Community License restringe el uso comercial a plataformas con menos de 700 millones de usuarios activos: solo afecta a un puñado de gigantes globales.
Qwen 3.7 Max (Alibaba): el mejor en español y multilingüe
Qwen 3.7 Max se lanzó el 20 de mayo de 2026 con ventana de 1 millón de tokens, modo de razonamiento extendido nativo y benchmarks tope en SWE-Pro con 60,6, Terminal-Bench 2.0 con 69,7 y GPQA Diamond con 92,4 (bate a Claude Opus 4.6 Max con 91,3). En el Intelligence Index se sitúa en 56,6 puntos, 4,8 por encima del preview de Qwen 3.6 Max.
La verdadera fortaleza de Qwen para nuestro público está en la evaluación multilingüe: el modelo ocupa el puesto número uno en la categoría Multilingual de Artificial Analysis. Alibaba entrenó su tokenizer con proporciones deliberadamente altas de español, portugués, francés y árabe, y el resultado se nota: Qwen produce castellano fluido, correcto y natural, con menos calcos del inglés que Llama o Claude.
Aviso: Alibaba movió la línea Max a producto cerrado. Los pesos de Qwen 3.7 Max NO son públicos. Lo que sí está abierto es toda la familia Qwen3 (versiones 7B, 14B, 32B, 72B y el masivo 235B) bajo Qwen License, con el mismo tokenizer multilingüe y muy buen rendimiento en su rango de tamaños. Para uso en local con soporte fuerte de español, Qwen3 32B es la elección natural. Para API con calidad frontier en castellano, Qwen 3.7 Max sigue siendo la referencia.
Mistral Medium 3.5: el modelo europeo de velocidad
Mistral AI, el laboratorio francés, se ha especializado en modelos densos de tamaño medio con énfasis en latencia. Mistral Medium 3.5 se lanzó el 30 de abril de 2026: dense 128B, ventana de 262.000 tokens, licencia Apache 2.0 (la más permisiva del mercado) y velocidad de 135,6 tokens por segundo en salida, muy por encima de la media del segmento.
Precio API: 1,50 dólares por millón de tokens de entrada y 7,50 de salida. Está por encima del budget de Medium 3 (0,40 y 2,00) pero por debajo de GPT-4o y Claude Sonnet 4. Puntuá 30 en el Intelligence Index, cifra correcta para su tamaño pero lejos del frontier. Su tiempo hasta el primer token es de 2,47 segundos, algo elevado, aunque el throughput compensa en workloads largos.
Lo interesante de Mistral: gobernanza europea, cumplimiento RGPD por diseño y servidores en Francia. Para empresas españolas con requisitos de soberanía de datos es hoy la única opción frontier que combina licencia permisiva y jurisdicción UE.
Meituan LongCat-2.0: 1,6 billones MIT desde chips chinos
El lanzamiento más político y técnicamente arriesgado del año. Meituan (el gigante de reparto y servicios locales chino) liberó LongCat-2.0 el 30 de junio de 2026 con estas características: Mixture-of-Experts con 1,6 billones de parámetros totales y 48.000 millones activos por token, licencia MIT (la más permisiva posible para un modelo de este tamaño), ventana nativa de 1 millón de tokens y una arquitectura de atención propia llamada LongCat Sparse Attention.
El dato geopolítico: LongCat-2.0 es el primer modelo trillion-parameter entrenado y servido end-to-end en chips fabricados en China, sin una sola GPU de Nvidia. Meituan usó un clúster doméstico de 50.000 ASICs. Los controles de exportación no han impedido a China alcanzar la frontera.
En benchmarks LongCat-2.0 supera a Claude Opus (referencia) en IFEval con 90,0 frente a 86,0, y en IMO-AnswerBench con 81,8 frente a 75,3. Rinde peor en SWE-bench Pro (59,5 frente a 69,2), lo que le sitúa por detrás de GLM-5.2 y Kimi K3 en coding puro. Para agentes y evaluaciones de instrucción, sin embargo, es competitivo con el frontier cerrado.
Despliegue: 16 GPUs H20 recomendadas, con variante FP8 quantizada en Hugging Face. No es para casa, pero para clouds e integradores es una alternativa MIT sin par en tamaño.
Google Gemma 3: la mejor familia pequeña para VRAM de consumo
Google mantiene su línea Gemma como el hermano abierto y ligero de Gemini. Gemma 3 llega en cuatro tamaños pensados para hardware de consumo: 1B, 4B, 12B y 27B parámetros. Incluye comprensión de visión, 128.000 tokens de contexto y soporte multilingüe para más de 140 idiomas, con calidad decente en español.
En benchmarks, Gemma 3 rinde a la altura de modelos varias veces más grandes: en las evaluaciones preliminares de LMArena supera a Llama3-405B, DeepSeek-V3 y o3-mini en preferencia humana ciega. La receta es distillation desde Gemini 2.0, con un tokenizer optimizado para eficiencia. Los pesos se publican bajo Gemma Terms of Use, una licencia menos permisiva que MIT pero suficiente para casi cualquier caso comercial.
Caso de uso principal: ejecutar IA totalmente offline en un portátil o mini PC con 8-16 GB de VRAM. Gemma 3 4B cabe en una integrada AMD Radeon 780M; Gemma 3 27B corre cómodamente en una RTX 4090 Q4_K_M.
¿Cuál modelo elegir según tu caso de uso?
La comparativa es útil para entender el paisaje, pero necesitas una recomendación directa. Cinco decisiones habituales:
- Asistente de coding profesional: GLM-5.2 vía Z.ai o OpenRouter. Es el mejor open source en SWE-bench Pro y a un sexto del coste de GPT-5.5. Alternativa premium: Kimi K3 si necesitas frontend puro.
- Trabajo intensivo en español (contenido, redacción, análisis): Qwen 3.7 Max vía API. Alternativa open weights: Qwen3 72B en local.
- Agentes multi-paso y RAG con contexto masivo: Llama 4 Scout por sus 10 millones de tokens de ventana. Alternativa: GLM-5.2 si la calidad de razonamiento importa más que la longitud absoluta.
- Volumen alto a bajo coste: DeepSeek V4 Flash. 0,14 dólares por millón de entrada, casi imbatible.
- Chatbot offline en tu portátil: Gemma 3 12B o Llama 4 Scout Q4. Ambos rinden bien con 12-16 GB de VRAM. Si tu equipo es un Mac reciente, la opción natural es Gemma 3 27B en Metal.
Para quien viene del mundo cerrado y quiere comparar con GPT y Claude, tenemos análisis lado a lado en Gemini 3.6 Flash vs GPT-5.6 y Claude Fable 5 comparativa.
Cómo probar estos modelos: local (Ollama, LM Studio) vs API (OpenRouter, Fireworks, Together)
Dos rutas para arrancar:
Ruta API (cero fricción, empiezas en cinco minutos). Regstrate en OpenRouter, Fireworks o Together AI. Con una sola API key tienes acceso a Kimi K3, GLM-5.2, DeepSeek V4, Llama 4 Scout y Maverick, Qwen y Mistral. Precio unificado en dólares por millón de tokens, sin infraestructura. Ideal para prototipos, pruebas de concepto y producto en fase temprana.
Ruta local (privacidad total, coste marginal cero). Instala Ollama o LM Studio. Ambos gratuitos, con builds nativos para Windows, macOS y Linux. Ollama es CLI, ideal para servidores; LM Studio aporta GUI y servidor OpenAI-compatible. Para frontier open (GLM-5.2, Maverick) necesitas hardware serio; Gemma 3 y Scout van en un portátil o una RTX 4070.
Ruta híbrida (recomendada en producción): local para desarrollo, staging y datos sensibles; API en producción para pico de carga. Así combinas privacidad, coste bajo y elasticidad.
Hardware mínimo para probar modelos IA open source en casa
Ejecutar modelos abiertos en local requiere una workstation pensada para inferencia. Regla básica: 8 GB de VRAM para 7-8B, 24 GB para 32B y 48-64 GB para 70B, todo con cuantización Q4_K_M. Nuestras recomendaciones para agosto de 2026:
Opción mini PC (todo en uno con memoria unificada): el Beelink SER8 con Ryzen 7 8845HS te da 32 GB DDR5 en un chasis compacto, y ejecuta Gemma 3 12B y Llama 4 Scout Q4 sin problemas. Para saltar a modelos medianos, el MINISFORUM UM790 Pro ofrece hasta 64 GB y mejor perfil térmico para inferencia sostenida.
Opción Mac (memoria unificada masiva): el MacBook Pro M4 de 14 pulgadas con 32-48 GB de memoria unificada corre Gemma 3 27B a velocidad de lectura y Qwen3 32B a ritmo de conversación. Para GLM-5.2 completo o Llama 4 Maverick, salta al Mac Studio M3 Ultra con 192 GB.
Opción GPU discreta (máxima velocidad): la ASUS ROG Astral GeForce RTX 5090 con 32 GB de GDDR7 es hoy la mejor GPU de consumo para inferencia. Ejecuta Gemma 3 27B y Qwen3 72B Q4 a 50 tokens por segundo. Combina con un procesador AMD Ryzen 9 9950X3D y placa base AM5.
Periféricos para largas sesiones de trabajo: monitor LG UltraGear OLED para leer respuestas largas sin fatiga, teclado Keychron K8 Pro mecánico para escribir prompts durante horas, ratón Logitech MX Master 3S para navegación precisa entre docs, auriculares Sony WH-1000XM5 para enfoque en oficina compartida, y una silla IKEA Markus para no destrozarte la espalda tras horas evaluando modelos.
Recursos y libros para profundizar
Para entender el porqué de las arquitecturas MoE, la cuantización Q4 o los sistemas de agentes que aprovechan estos modelos, hay tres libros de referencia obligada en 2026:
- AI Engineering (Chip Huyen): cubre desde diseño de prompts hasta despliegue de sistemas RAG y evaluación. Es el mapa para pasar de jugar con la API a producto real. Lectura casi obligatoria si trabajas con estos modelos profesionalmente.
- Hands-On Machine Learning (Aurélien Géron, 3.ª ed.): la biblia moderna del ML práctico con Scikit-learn, Keras y TensorFlow, con capítulos actualizados sobre transformers y difusión.
- Fluent Python (Luciano Ramalho, 2.ª ed.): para escribir el código Python idiomático que orquestará tus llamadas a Ollama, tus pipelines de RAG y tus agentes MCP.
Preguntas frecuentes (FAQ)
¿Cuál es el mejor modelo de IA open source en agosto de 2026?
De propósito general, Kimi K3 de Moonshot es el líder actual con 80,2 puntos en el Intelligence Index. Para coding, GLM-5.2 supera a GPT-5.5 en SWE-bench Pro. Para volumen barato, DeepSeek V4 Flash. Para español, Qwen 3.7 Max. La elección depende de tu caso.
¿Puedo ejecutar Kimi K3 o GLM-5.2 en mi ordenador de casa?
No de forma práctica. Kimi K3 requiere al menos ocho GPUs H100. GLM-5.2 necesita dos H100 o un Mac Studio M3 Ultra de 192 GB. Para casa aspira a Gemma 3, Llama 4 Scout, Qwen3 32B o Mistral Small, que caben en una RTX 4090 o un MacBook Pro M4.
¿Qué significa exactamente open source en modelos de IA?
La comunidad usa tres niveles: open source estricto (pesos, código, datos), open weights permissive (pesos con MIT o Apache) y open weights restringido (pesos con condiciones). La mayoría de modelos frontier son de las dos últimas categorías. LongCat-2.0 y GLM-5.2 tienen la licencia más permisiva actual (MIT).
¿Cuánto cuesta usar DeepSeek V4 frente a GPT-4 vía API?
DeepSeek V4 Pro cuesta 0,435 dólares por millón de tokens de entrada y 0,87 de salida. Frente a Claude Opus 4.7, DeepSeek es 34 veces más barato en entrada y 86 veces más barato en salida. V4 Flash baja a 0,14 y 0,28 respectivamente, situándose entre las APIs frontier más baratas del mercado.
¿Llama 4 Scout con 10 millones de tokens de contexto es real o marketing?
La ventana declarada de 10M es real y funciona, pero por encima de 512K la calidad de razonamiento cae notablemente. Para RAG masivo o consulta de bases documentales enormes es útil. Para razonamiento profundo dentro del contexto conviene mantenerse por debajo de 128K, donde la calidad es competitiva con Claude y GPT.
¿Qué modelo open source es mejor para escribir en español?
Qwen 3.7 Max (vía API) es el líder actual en multilingüe y produce castellano fluido y natural. Para open weights, Qwen3 32B o 72B mantienen la misma calidad de tokenizer y son ejecutables en local. Llama 4 y Gemma 3 tienen buen español pero con más calcos del inglés. Mistral Medium 3.5 es correcto y cumple RGPD.
¿Vale la pena montar una workstation de inferencia local en 2026?
Depende del volumen. Si haces menos de 5 millones de tokens al mes, sale más barato usar API con DeepSeek V4 Flash. Por encima de eso, y sobre todo si trabajas con datos sensibles (médicos, jurídicos, corporativos), una workstation con RTX 5090 o Mac Studio M3 Ultra se amortiza en meses.
¿LongCat-2.0 entrenado en chips chinos es fiable para producción europea?
Técnicamente sí, la licencia MIT permite cualquier uso. La cuestión no es técnica sino de riesgo geopolítico y proveedor. Si tu cliente exige transparencia sobre el origen del modelo, considera Mistral Medium 3.5 (Francia) o Llama 4 (EE. UU.) como alternativas.
Conclusión: el mejor momento para adoptar IA open source
El mensaje de agosto de 2026 es claro: los modelos abiertos ya no son la alternativa barata al frontier propietario, son parte del propio frontier. Kimi K3 compite con Claude Fable 5 y GPT-5.6. GLM-5.2 supera a GPT-5.5 en coding. LongCat-2.0 demuestra que el liderazgo tecnológico ya no depende de Nvidia. Y todo con precios de API entre 5 y 30 veces inferiores a los cerrados.
Nuestra recomendación: dedica una tarde a probar tres modelos vía OpenRouter (GLM-5.2, Kimi K3, DeepSeek V4 Flash) con tu caso real. Es la mejor inversión de tiempo posible en IA ahora mismo.
Este artículo contiene enlaces afiliados a Amazon con el tag webmasteroson-21. Si compras a través de estos enlaces, Arkaia puede recibir una comisión sin coste adicional para ti. Nuestra valoración editorial es independiente y no varía según los ingresos por afiliación.
Comentarios
Inicia sesion para dejar un comentario
Acceder