Cinco días bastaron para que el mapa de la IA frontier volviera a temblar. El 18 de julio de 2026, Moonshot AI anunciaba Kimi K3, un modelo open source con 2,8 billones de parámetros pensado para competir de tú a tú con OpenAI y Anthropic y con lanzamiento gratuito para desarrolladores previsto a finales de mes. Casi al mismo tiempo, Alibaba respondía con Qwen 3.8 Max, del que asegura que solo Claude Fable 5 lo supera en benchmarks globales. Ambos aterrizan detrás del reciente Z.ai GLM-5.2 y del DeepSeek V4, y confirman que la IA china frontier ha dejado de perseguir para liderar por bloques.
Kimi K3 (Moonshot): 2,8 billones de parámetros open source
Moonshot AI, la casa detrás del asistente Kimi y célebre por su liderazgo en contexto ultra-largo con Kimi K2, dio el salto el 18 de julio con el anuncio de Kimi K3. Cifras nuevas, filosofía de siempre: pesos abiertos, licencia permisiva y descarga directa para desarrolladores en cualquier país del mundo prevista a finales de julio de 2026.
La arquitectura: 2,8 billones y un MoE denso a la vez
La cifra estrella es contundente: 2,8 billones de parámetros totales (2,8 × 10¹²). No es un denso monolítico sino un Mixture-of-Experts con 384 expertos y unos 64.000 millones de parámetros activos por token. Es el patrón que hoy domina la escena china: escala masiva total, activación selectiva y coste de inferencia manejable.
Los pilares que Moonshot destaca en el paper técnico y en la ficha del modelo son cuatro:
- Contexto de 2 millones de tokens con retrieval agentic nativo, heredando la firma casera de Moonshot para bases documentales y código legacy.
- Razonamiento profundo configurable: modo rápido, modo pensante y modo agente con presupuesto explicito de pasos, similar al modo pensante de Claude Fable 5.
- Multimodalidad texto, imagen, audio y vídeo entrenada desde cero, con un tokenizador unificado para señales visuales y sonoras.
- Licencia open source total: pesos, tokenizador, código de referencia y scripts de fine-tuning bajo licencia derivada de Apache 2.0, sin las restricciones que otros frontier chinos aplican a operadores muy grandes.
Moonshot declara entrenamiento en clúster mixto de NVIDIA H100 (acumuladas antes del embargo) y aceleradores Huawei Ascend 910C, con coste en el entorno de los 90 millones de dólares: un orden de magnitud por debajo de GPT-5.6 o Fable 5.
Plan de lanzamiento y quiebre comercial
La estrategia comercial es tan agresiva como la arquitectura. Tres movimientos anunciados:
- Gratis para desarrolladores: descarga directa en HuggingFace y ModelScope a finales de julio, sin registro empresarial.
- API oficial low-cost con tarifas por debajo de las de DeepSeek V4.
- Programa educativo: créditos ilimitados seis meses para universidades europeas y latinoamericanas con dominio institucional.
Moonshot quiere convertir Kimi K3 en el modelo por defecto de la nueva hornada de desarrolladores fuera de EEUU, ocupando el hueco que dejan las restricciones de exportación de OpenAI.
Qwen 3.8 Max (Alibaba): solo Claude Fable 5 lo supera
El día siguiente al anuncio de Kimi K3, Alibaba Cloud respondió desde su feudo con la actualización mayor de la familia insignia: Qwen 3.8 Max. La afirmación oficial de Alibaba, publicada en la nota de prensa del laboratorio Tongyi, no admite matices: en la mayoría de benchmarks globales solo Claude Fable 5 supera a Qwen 3.8 Max. Ni GPT-5.6, ni Gemini 3.5 Pro, ni Llama 5.
Características técnicas declaradas
Qwen 3.8 Max mantiene el enfoque MoE del linaje Qwen 3 pero da un salto de escala y calidad. Los parámetros públicos son estos:
- 1,2 billones de parámetros totales con 45.000 millones activos por token en la variante Max.
- Contexto de 1 millón de tokens con soporte agentic nativo para lectura de repositorios completos y expedientes legales largos.
- Multilingüe reforzado: 129 idiomas con mejora particular en árabe, indonesio, hindi, tailandés y variantes de español latino, alineado con los mercados prioritarios de Alibaba.
- Herramientas nativas: búsqueda web, ejecución de código Python y llamada a APIs externas integradas de fábrica sin necesidad de framework adicional.
Benchmarks: la letra pequeña
Alibaba publicó tres tablas comparativas junto al anuncio. Los números clave que dan sustento a la promesa "solo Fable 5 lo supera":
| Benchmark | Qwen 3.8 Max | Claude Fable 5 | GPT-5.6 Sol | Gemini 3.5 Pro |
|---|---|---|---|---|
| MMLU Pro | 91,1 % | 91,4 % | 91,0 % | 90,7 % |
| HumanEval (código) | 93,9 % | 94,0 % | 93,6 % | 92,8 % |
| SWE-bench Verified | 82 % | 83 % | 82 % | 79 % |
| MATH-500 | 88,9 % | 89,1 % | 88,4 % | 86,9 % |
| GPQA Diamond | 84,5 % | 85,2 % | 84,0 % | 82,3 % |
| Intelligence Index | 65 | 66 | 65 | 63 |
La lectura fina matiza el mensaje: Qwen 3.8 Max empata con GPT-5.6 Sol y se queda a décimas de Fable 5. Artificial Analysis confirmó el 20 de julio un Intelligence Index de 65, un punto por debajo de Fable 5 y empatado con GPT-5.6.
Comparativa: Kimi K3 vs Qwen 3.8 Max vs GLM-5.2 vs DeepSeek V4
El ecosistema frontier chino de julio de 2026 ya no cabe en un solo párrafo. Con Kimi K3 y Qwen 3.8 Max se cierra un cuarteto que domina la conversación global de la IA open source. La foto de conjunto queda así.
| Modelo | Parámetros totales | Activos | Contexto | Licencia | Intelligence Index |
|---|---|---|---|---|---|
| Kimi K3 | 2,8 billones | 64.000 M | 2M tokens | Open source (Apache 2.0) | 65 (previsto) |
| Qwen 3.8 Max | 1,2 billones | 45.000 M | 1M tokens | API + open weights parcial | 65 |
| GLM-5.2 | 340.000 M | 32.000 M | 1M tokens | Open weights (condicionada) | 63 |
| DeepSeek V4 | 1 billón | 32.000 M | 512K tokens | Open weights (MIT-like) | 64 |
Cada uno se posiciona en un flanco distinto:
- Kimi K3 es el más ambicioso en escala y el más abierto: pesos y código bajo licencia Apache 2.0 real, contexto de 2 millones de tokens y multimodalidad completa.
- Qwen 3.8 Max es el más equilibrado y el mejor integrado en un ecosistema empresarial (Alibaba Cloud, DingTalk, PolarDB), con soporte industrial multilingue.
- GLM-5.2 es el más barato en API y el más ligero para desplegar en local con una sola RTX 5090.
- DeepSeek V4 mantiene el liderazgo en código puro y sigue siendo la referencia de eficiencia computacional entre los frontier chinos.
Coste por token y sacudida del mercado
Las tarifas oficiales publicadas la semana del 18 de julio de 2026 confirman que la sacudida no es sólo técnica sino también comercial:
| Modelo | Input (USD / 1M tokens) | Output (USD / 1M tokens) |
|---|---|---|
| Kimi K3 | 0,15 | 0,60 |
| Qwen 3.8 Max | 0,80 | 2,40 |
| Z.ai GLM-5.2 | 0,20 | 0,80 |
| DeepSeek V4 | 0,27 | 1,10 |
| Gemini 3.5 Pro | 1,25 | 5,00 |
| Claude Fable 5 | 3,00 | 15,00 |
| GPT-5.6 Sol | 3,00 | 15,00 |
Kimi K3 rompe el suelo del precio en frontier: 25 veces más barato que Claude Fable 5 en output. Qwen 3.8 Max es más caro que sus vecinos chinos, pero se justifica con soporte empresarial premium y SLA industrial. La conclusión operativa es evidente: el routing inteligente deja de ser una curiosidad y se convierte en obligación estratégica. Cada equipo tiene ahora un menú amplio para asignar tareas críticas a Fable 5 y batches masivos a Kimi K3 o GLM-5.2.
Cómo probarlos en España paso a paso
Ninguno de los dos modelos exige registro empresarial ni licencia de exportación. Cuatro vías prácticas para empezar hoy desde España.
1. HuggingFace y despliegue local
Los pesos completos de Kimi K3 estarán en HuggingFace y ModelScope a finales de julio. Los ficheros safetensors superan el terábyte por la escala del modelo, pero Moonshot publica cuantizaciones AWQ y GGUF Q4 que reducen la huella a unos 320 GB. Requiere clúster multi-GPU: 8 tarjetas H100 o 4 clusters de RTX 5090 con offload NVMe. Qwen 3.8 Max libera solo variantes destiladas open weights (32B, 72B, 235B); el modelo Max completo se consume por API oficial.
2. API oficial y proveedores serverless
Moonshot abrirá su endpoint OpenAI-compatible con base_url=https://api.moonshot.cn/v1. Alibaba mantiene la API insignia en dashscope.aliyuncs.com. En paralelo, Together AI, Fireworks, OpenRouter y Groq ya han confirmado inclusión de Kimi K3 en sus catálogos desde el día de la publicación. Para equipos europeos preocupados por la residencia de datos, los proveedores serverless de EEUU o UE actúan como intermediario contractual.
3. Colibri y variantes destiladas
La comunidad ya trabaja en versiones destiladas de Kimi K3 en el rango 7B-32B, ejecutables en un portátil gaming decente con nuestra guía Colibri. Para Qwen 3.8 Max la casa oficial ya ofrece qwen3-max-32b-distill con licencia Apache 2.0 y benchmarks a ocho puntos del modelo completo. Es la manera realista de probar el estilo del modelo sin cluster.
4. Ollama, LM Studio y Mac Silicon
La cuantización Q4_K_M de las variantes destiladas cabe en un Mac Mini M4 con memoria unificada; una RTX 5090 mueve la Q5. LM Studio incorporó el runner de arquitectura MoE de Moonshot en su versión 0.4.9, publicada también el 18 de julio, y Ollama ha añadido los tags oficiales kimi-k3:distill y qwen3.8-max:distill.
Para exprimir estas variantes destiladas en casa este verano, el hardware recomendado es el siguiente:
- NVIDIA GeForce RTX 5090 Founders Edition en Amazon, 32 GB de GDDR7, la única GPU de consumo capaz de mover variantes destiladas de Kimi K3 con contexto útil.
- NVIDIA GeForce RTX 5080 Founders Edition en Amazon, 16 GB GDDR7, alternativa asequible para modelos destilados de 32B con cuantización Q4.
- GIGABYTE GeForce RTX 5070 Ti Gaming OC 16GB en Amazon, equilibrio coste/capacidad para experimentar con variantes 27-32B en escritorio.
- Apple Mac mini M4 en Amazon, opción silenciosa y compacta para inferencia MLX de variantes destiladas Kimi/Qwen con memoria unificada eficiente.
- Google Coral Edge TPU USB Accelerator en Amazon, coprocesador USB de bajo consumo ideal para inferencia edge y prototipado ligero con Raspberry Pi.
Ventajas y desventajas frente a Claude Fable 5 y GPT-5.6 Sol
Con Kimi K3 y Qwen 3.8 Max en la mesa, la comparación con los frontier estadounidenses ya no es académica. Estas son las palancas que hoy inclinan la balanza en cada dirección.
A favor de los modelos chinos
- Precio. Kimi K3 es 25 veces más barato en output que Fable 5. Un pipeline masivo con Kimi K3 paga en un año lo que Fable 5 en dos semanas.
- Apertura. Kimi K3 se descarga y ejecuta on-premise. Fable 5 y GPT-5.6 Sol siguen siendo servicios cerrados.
- Contexto. Kimi K3 llega a 2 millones de tokens nativos, cuatro veces más que GPT-5.6 Sol.
- Sin restricciones geográficas. Tras la revisión de las EAR estadounidenses cubierta en nuestro análisis de GPT-5.6, muchos frontier occidentales aplican licencias especiales de exportación. Los chinos no.
A favor de Claude Fable 5 y GPT-5.6 Sol
- Calidad en SWE-bench Verified. Fable 5 mantiene una ventaja de 1-5 puntos consistente en agentes autónomos de código, algo crítico para herramientas como Claude Code.
- Ecosistema y tooling. SDKs maduros, integraciones con IDEs, MCP, guardrails oficiales y soporte empresarial 24/7.
- Auditoría y datasheet. Anthropic y OpenAI publican tarjetas de modelo detalladas y datasheets para cumplimiento normativo europeo.
- Sin sesgo geopolítico explícito. Los frontier occidentales no aplican censura sobre temas críticos del PCCh, algo relevante para medios, ONG y contenidos regulados.
Riesgos de privacidad y jurisdicción china
Consumir un modelo chino no es una decisión neutra. Tres frentes que conviene decidir antes de mover una sola carga a producción.
Residencia de datos
La API oficial de Moonshot procesa peticiones en centros de datos ubicados en China continental y Hong Kong. Aplica por defecto la Cybersecurity Law de 2017 y la Personal Information Protection Law de 2021. Para datos sensibles bajo el RGPD europeo, la vía correcta es desplegar los pesos en infraestructura propia dentro del EEE o consumir el modelo vía intermediario serverless con contrato europeo.
Sesgo político y censura
Ambos modelos aplican filtros de contenido sobre temas sensibles en su jurisdicción de origen: Tiananmen 1989, Taiwan, Tíbet, Uigures y la figura de Xi Jinping. En pruebas reproducibles publicadas por investigadores de EleutherAI el 20 de julio, Kimi K3 rechaza responder o produce respuestas neutras. En tareas técnicas y creativas neutras el efecto es imperceptible, pero conviene documentar el sesgo si el modelo se expone a usuarios finales.
Trazabilidad del corpus
Ni Moonshot ni Alibaba publican datasheet detallada del corpus de entrenamiento. Para sistemas de alto riesgo bajo la EU AI Act, es un obstáculo formal serio. Recomendación: capa de guardrails propia y filtros de output antes de exponer el modelo a público final.
Impacto geopolítico EEUU-China
Kimi K3 y Qwen 3.8 Max no llegan en el vacío. La administración Trump ha revisado las Export Administration Regulations para incluir modelos frontier en la lista de tecnologías de doble uso; OpenAI aceptó restricciones que dejan a GPT-5.6 Sol fuera del alcance europeo hasta que se negocie una excepción. Anthropic reabrió Fable en Europa hace un par de semanas tras negociar con la Casa Blanca, pero el precedente ha marcado a toda la industria: la política puede cerrar el acceso a un frontier occidental en días, mientras los pesos de Kimi K3 estarán en HuggingFace para siempre.
Tres consecuencias inmediatas para el mercado europeo:
- Presión bajista sobre precios. Con Kimi K3 en 0,60 dólares por millón de tokens de output, sostener 15 dólares es difícil salvo en workloads sensibles a calidad marginal.
- Fragmentación regulatoria. Europa se encuentra con un frontier chino open source desplegable dentro del EEE, lo que abre debates sobre soberanía digital, residencia de datos y auditoría.
- Aceleración del silicio nacional chino. El entrenamiento de Kimi K3 combina H100 con Ascend 910C. Las sanciones han empujado a Huawei y SMIC a madurar más rápido. En 2027 esperamos frontier chinos entrenados ya al 100 % en silicio doméstico.
Formación para entender la ola
Si quieres reconstruir la base conceptual para opinar con criterio sobre esta ola, tres lecturas de cabecera imprescindibles:
- "Inteligencia Artificial: Un enfoque moderno" de Russell y Norvig en Amazon, manual universitario de referencia; imprescindible para entender qué hay bajo un MoE de 2,8 billones.
- "Superinteligencia" de Nick Bostrom en Amazon, ensayo obligado para pensar riesgos y gobernanza de la IA frontier a escala global.
- "Vida 3.0" de Max Tegmark en Amazon, visión de largo plazo sobre el futuro humano en la era de la IA avanzada.
Conclusión: el frontier open source es plural y chino
Kimi K3 y Qwen 3.8 Max cierran una fotografía contundente en julio de 2026: cuatro laboratorios chinos compiten de tú a tú con Claude Fable 5 y GPT-5.6 Sol, con pesos abiertos, contexto ultra-largo y precios que tambalean los márgenes del sector. Para el desarrollador español, más opciones y menos coste. Para Washington, un aviso sin ambigüedad. La era multipolar de la IA frontier ha llegado con acento chino.
Preguntas frecuentes
¿Cuándo se puede descargar Kimi K3 gratis?
Moonshot AI ha confirmado la liberación de los pesos a finales de julio de 2026 en HuggingFace y ModelScope bajo licencia derivada de Apache 2.0. La descarga será gratuita para desarrolladores de cualquier país, sin registro empresarial ni firma de acuerdos previos.
¿Qué significan los 2,8 billones de parámetros de Kimi K3?
2,8 billones en notación española equivale a 2,8 × 10¹² parámetros (2,8 trillion en inglés). Es la escala total del modelo, con una arquitectura Mixture-of-Experts que activa solo unos 64.000 millones por token, lo que mantiene el coste de inferencia asequible pese al tamaño.
¿Es verdad que solo Claude Fable 5 supera a Qwen 3.8 Max?
En los benchmarks publicados por Alibaba y las primeras verificaciones independientes, Qwen 3.8 Max empata prácticamente con GPT-5.6 Sol y Gemini 3.5 Pro y se queda a décimas de Claude Fable 5. La afirmación es técnicamente sostenible en la mayoría de tests estándar, aunque la ventaja de Fable sigue siendo consistente en SWE-bench y agentes autónomos.
¿Cuánto cuesta usar Kimi K3 comparado con Claude Fable 5?
Kimi K3 costará 0,15 dólares por millón de tokens de input y 0,60 dólares por millón de output. Claude Fable 5 cobra 3,00 y 15,00 respectivamente. Kimi K3 es 25 veces más barato en output, la mayor brecha jamás registrada entre dos modelos con benchmarks comparables.
¿Puedo ejecutar Kimi K3 en un PC de escritorio?
El modelo completo no; hacen falta al menos 8 GPUs H100 o clústeres equivalentes. Sin embargo, la comunidad publicará variantes destiladas en el rango 7B-32B ejecutables en una RTX 5090 con 32 GB de VRAM, y para prototipado ligero un Mac Mini M4 mueve las cuantizaciones Q4.
¿Es seguro usar Kimi K3 o Qwen 3.8 Max desde España?
La API oficial de ambos procesa peticiones en servidores chinos y aplica la Cybersecurity Law y la PIPL china. Para datos sensibles bajo el RGPD conviene desplegar los pesos en infraestructura propia dentro del EEE o consumir el modelo vía proveedor serverless (Together, Fireworks, OpenRouter) con contrato europeo.
¿Tienen sesgo político Kimi K3 y Qwen 3.8 Max?
Sí. Ambos aplican filtros de contenido sobre temas políticamente sensibles en China (Tiananmen 1989, Taiwan, Tíbet, Uigures, la figura de Xi Jinping). Para tareas técnicas o creativas neutras el efecto es imperceptible, pero conviene documentar el sesgo si el modelo se expone a usuarios finales o cubre contenido político.
¿Cómo se comparan con GLM-5.2 y DeepSeek V4?
Los cuatro modelos están en el mismo rango de calidad. Kimi K3 lidera en escala, contexto y precio; Qwen 3.8 Max tiene el mejor ecosistema empresarial y multilingüe; GLM-5.2 es el más ligero para desplegar en local; DeepSeek V4 mantiene su ventaja en código puro. Cada vez más equipos montan arquitecturas híbridas combinando varios según el tipo de tarea.
Aviso: este artículo incluye enlaces de afiliado de Amazon. Si compras a través de ellos, Arkaia recibe una pequeña comisión sin coste adicional para ti. Los precios y la disponibilidad pueden variar; consulta siempre la ficha actualizada en Amazon antes de comprar.
Comentarios
Inicia sesion para dejar un comentario
Acceder