Kimi K3 (Moonshot) y Qwen 3.8 Max (Alibaba): los dos modelos frontier open source chinos de julio 2026
Volver al blog
IA 21 Julio 2026 12 min lectura 22 visitas

Kimi K3 y Qwen 3.8 Max: los dos modelos chinos frontier que sacuden julio de 2026

Arkaia Editorial
Arkaia Editorial Editor

Cinco días bastaron para que el mapa de la IA frontier volviera a temblar. El 18 de julio de 2026, Moonshot AI anunciaba Kimi K3, un modelo open source con 2,8 billones de parámetros pensado para competir de tú a tú con OpenAI y Anthropic y con lanzamiento gratuito para desarrolladores previsto a finales de mes. Casi al mismo tiempo, Alibaba respondía con Qwen 3.8 Max, del que asegura que solo Claude Fable 5 lo supera en benchmarks globales. Ambos aterrizan detrás del reciente Z.ai GLM-5.2 y del DeepSeek V4, y confirman que la IA china frontier ha dejado de perseguir para liderar por bloques.

Dos modelos de IA frontier open source presentados en julio de 2026 que compiten con Claude Fable 5 y GPT-5.6
Kimi K3 y Qwen 3.8 Max: la ofensiva open source que redefine la conversación frontier en julio de 2026

Kimi K3 (Moonshot): 2,8 billones de parámetros open source

Moonshot AI, la casa detrás del asistente Kimi y célebre por su liderazgo en contexto ultra-largo con Kimi K2, dio el salto el 18 de julio con el anuncio de Kimi K3. Cifras nuevas, filosofía de siempre: pesos abiertos, licencia permisiva y descarga directa para desarrolladores en cualquier país del mundo prevista a finales de julio de 2026.

La arquitectura: 2,8 billones y un MoE denso a la vez

La cifra estrella es contundente: 2,8 billones de parámetros totales (2,8 × 10¹²). No es un denso monolítico sino un Mixture-of-Experts con 384 expertos y unos 64.000 millones de parámetros activos por token. Es el patrón que hoy domina la escena china: escala masiva total, activación selectiva y coste de inferencia manejable.

Los pilares que Moonshot destaca en el paper técnico y en la ficha del modelo son cuatro:

  • Contexto de 2 millones de tokens con retrieval agentic nativo, heredando la firma casera de Moonshot para bases documentales y código legacy.
  • Razonamiento profundo configurable: modo rápido, modo pensante y modo agente con presupuesto explicito de pasos, similar al modo pensante de Claude Fable 5.
  • Multimodalidad texto, imagen, audio y vídeo entrenada desde cero, con un tokenizador unificado para señales visuales y sonoras.
  • Licencia open source total: pesos, tokenizador, código de referencia y scripts de fine-tuning bajo licencia derivada de Apache 2.0, sin las restricciones que otros frontier chinos aplican a operadores muy grandes.

Moonshot declara entrenamiento en clúster mixto de NVIDIA H100 (acumuladas antes del embargo) y aceleradores Huawei Ascend 910C, con coste en el entorno de los 90 millones de dólares: un orden de magnitud por debajo de GPT-5.6 o Fable 5.

Plan de lanzamiento y quiebre comercial

La estrategia comercial es tan agresiva como la arquitectura. Tres movimientos anunciados:

  • Gratis para desarrolladores: descarga directa en HuggingFace y ModelScope a finales de julio, sin registro empresarial.
  • API oficial low-cost con tarifas por debajo de las de DeepSeek V4.
  • Programa educativo: créditos ilimitados seis meses para universidades europeas y latinoamericanas con dominio institucional.

Moonshot quiere convertir Kimi K3 en el modelo por defecto de la nueva hornada de desarrolladores fuera de EEUU, ocupando el hueco que dejan las restricciones de exportación de OpenAI.

Diagrama conceptual de arquitectura Mixture-of-Experts con expertos activados selectivamente por token
Mixture-of-Experts con 384 expertos: 2,8 billones totales, 64.000 millones activos, coste de inferencia contenido

Qwen 3.8 Max (Alibaba): solo Claude Fable 5 lo supera

El día siguiente al anuncio de Kimi K3, Alibaba Cloud respondió desde su feudo con la actualización mayor de la familia insignia: Qwen 3.8 Max. La afirmación oficial de Alibaba, publicada en la nota de prensa del laboratorio Tongyi, no admite matices: en la mayoría de benchmarks globales solo Claude Fable 5 supera a Qwen 3.8 Max. Ni GPT-5.6, ni Gemini 3.5 Pro, ni Llama 5.

Características técnicas declaradas

Qwen 3.8 Max mantiene el enfoque MoE del linaje Qwen 3 pero da un salto de escala y calidad. Los parámetros públicos son estos:

  • 1,2 billones de parámetros totales con 45.000 millones activos por token en la variante Max.
  • Contexto de 1 millón de tokens con soporte agentic nativo para lectura de repositorios completos y expedientes legales largos.
  • Multilingüe reforzado: 129 idiomas con mejora particular en árabe, indonesio, hindi, tailandés y variantes de español latino, alineado con los mercados prioritarios de Alibaba.
  • Herramientas nativas: búsqueda web, ejecución de código Python y llamada a APIs externas integradas de fábrica sin necesidad de framework adicional.

Benchmarks: la letra pequeña

Alibaba publicó tres tablas comparativas junto al anuncio. Los números clave que dan sustento a la promesa "solo Fable 5 lo supera":

BenchmarkQwen 3.8 MaxClaude Fable 5GPT-5.6 SolGemini 3.5 Pro
MMLU Pro91,1 %91,4 %91,0 %90,7 %
HumanEval (código)93,9 %94,0 %93,6 %92,8 %
SWE-bench Verified82 %83 %82 %79 %
MATH-50088,9 %89,1 %88,4 %86,9 %
GPQA Diamond84,5 %85,2 %84,0 %82,3 %
Intelligence Index65666563

La lectura fina matiza el mensaje: Qwen 3.8 Max empata con GPT-5.6 Sol y se queda a décimas de Fable 5. Artificial Analysis confirmó el 20 de julio un Intelligence Index de 65, un punto por debajo de Fable 5 y empatado con GPT-5.6.

Barras comparativas de benchmarks entre los principales modelos frontier occidentales y asiáticos
Qwen 3.8 Max se queda a décimas de Fable 5 y empata con GPT-5.6 Sol en la mayoría de benchmarks estándar

Comparativa: Kimi K3 vs Qwen 3.8 Max vs GLM-5.2 vs DeepSeek V4

El ecosistema frontier chino de julio de 2026 ya no cabe en un solo párrafo. Con Kimi K3 y Qwen 3.8 Max se cierra un cuarteto que domina la conversación global de la IA open source. La foto de conjunto queda así.

ModeloParámetros totalesActivosContextoLicenciaIntelligence Index
Kimi K32,8 billones64.000 M2M tokensOpen source (Apache 2.0)65 (previsto)
Qwen 3.8 Max1,2 billones45.000 M1M tokensAPI + open weights parcial65
GLM-5.2340.000 M32.000 M1M tokensOpen weights (condicionada)63
DeepSeek V41 billón32.000 M512K tokensOpen weights (MIT-like)64

Cada uno se posiciona en un flanco distinto:

  • Kimi K3 es el más ambicioso en escala y el más abierto: pesos y código bajo licencia Apache 2.0 real, contexto de 2 millones de tokens y multimodalidad completa.
  • Qwen 3.8 Max es el más equilibrado y el mejor integrado en un ecosistema empresarial (Alibaba Cloud, DingTalk, PolarDB), con soporte industrial multilingue.
  • GLM-5.2 es el más barato en API y el más ligero para desplegar en local con una sola RTX 5090.
  • DeepSeek V4 mantiene el liderazgo en código puro y sigue siendo la referencia de eficiencia computacional entre los frontier chinos.

Coste por token y sacudida del mercado

Las tarifas oficiales publicadas la semana del 18 de julio de 2026 confirman que la sacudida no es sólo técnica sino también comercial:

ModeloInput (USD / 1M tokens)Output (USD / 1M tokens)
Kimi K30,150,60
Qwen 3.8 Max0,802,40
Z.ai GLM-5.20,200,80
DeepSeek V40,271,10
Gemini 3.5 Pro1,255,00
Claude Fable 53,0015,00
GPT-5.6 Sol3,0015,00

Kimi K3 rompe el suelo del precio en frontier: 25 veces más barato que Claude Fable 5 en output. Qwen 3.8 Max es más caro que sus vecinos chinos, pero se justifica con soporte empresarial premium y SLA industrial. La conclusión operativa es evidente: el routing inteligente deja de ser una curiosidad y se convierte en obligación estratégica. Cada equipo tiene ahora un menú amplio para asignar tareas críticas a Fable 5 y batches masivos a Kimi K3 o GLM-5.2.

Ejemplo práctico: un pipeline de análisis documental que procesa 50 millones de tokens de input y genera 5 millones de output al día pagaría unos 10,50 dólares diarios con Kimi K3 frente a 225 dólares con Claude Fable 5 o GPT-5.6 Sol. Al año, la diferencia supera los 78.000 dólares por un solo pipeline en producción.
Gráfica de coste por millón de tokens entre modelos frontier open source y comerciales occidentales
Kimi K3 y GLM-5.2 se pelean el suelo del precio; Fable 5 y GPT-5.6 defienden su premium con SLA y ecosistema

Cómo probarlos en España paso a paso

Ninguno de los dos modelos exige registro empresarial ni licencia de exportación. Cuatro vías prácticas para empezar hoy desde España.

1. HuggingFace y despliegue local

Los pesos completos de Kimi K3 estarán en HuggingFace y ModelScope a finales de julio. Los ficheros safetensors superan el terábyte por la escala del modelo, pero Moonshot publica cuantizaciones AWQ y GGUF Q4 que reducen la huella a unos 320 GB. Requiere clúster multi-GPU: 8 tarjetas H100 o 4 clusters de RTX 5090 con offload NVMe. Qwen 3.8 Max libera solo variantes destiladas open weights (32B, 72B, 235B); el modelo Max completo se consume por API oficial.

2. API oficial y proveedores serverless

Moonshot abrirá su endpoint OpenAI-compatible con base_url=https://api.moonshot.cn/v1. Alibaba mantiene la API insignia en dashscope.aliyuncs.com. En paralelo, Together AI, Fireworks, OpenRouter y Groq ya han confirmado inclusión de Kimi K3 en sus catálogos desde el día de la publicación. Para equipos europeos preocupados por la residencia de datos, los proveedores serverless de EEUU o UE actúan como intermediario contractual.

3. Colibri y variantes destiladas

La comunidad ya trabaja en versiones destiladas de Kimi K3 en el rango 7B-32B, ejecutables en un portátil gaming decente con nuestra guía Colibri. Para Qwen 3.8 Max la casa oficial ya ofrece qwen3-max-32b-distill con licencia Apache 2.0 y benchmarks a ocho puntos del modelo completo. Es la manera realista de probar el estilo del modelo sin cluster.

4. Ollama, LM Studio y Mac Silicon

La cuantización Q4_K_M de las variantes destiladas cabe en un Mac Mini M4 con memoria unificada; una RTX 5090 mueve la Q5. LM Studio incorporó el runner de arquitectura MoE de Moonshot en su versión 0.4.9, publicada también el 18 de julio, y Ollama ha añadido los tags oficiales kimi-k3:distill y qwen3.8-max:distill.

Para exprimir estas variantes destiladas en casa este verano, el hardware recomendado es el siguiente:

Ventajas y desventajas frente a Claude Fable 5 y GPT-5.6 Sol

Con Kimi K3 y Qwen 3.8 Max en la mesa, la comparación con los frontier estadounidenses ya no es académica. Estas son las palancas que hoy inclinan la balanza en cada dirección.

A favor de los modelos chinos

  • Precio. Kimi K3 es 25 veces más barato en output que Fable 5. Un pipeline masivo con Kimi K3 paga en un año lo que Fable 5 en dos semanas.
  • Apertura. Kimi K3 se descarga y ejecuta on-premise. Fable 5 y GPT-5.6 Sol siguen siendo servicios cerrados.
  • Contexto. Kimi K3 llega a 2 millones de tokens nativos, cuatro veces más que GPT-5.6 Sol.
  • Sin restricciones geográficas. Tras la revisión de las EAR estadounidenses cubierta en nuestro análisis de GPT-5.6, muchos frontier occidentales aplican licencias especiales de exportación. Los chinos no.

A favor de Claude Fable 5 y GPT-5.6 Sol

  • Calidad en SWE-bench Verified. Fable 5 mantiene una ventaja de 1-5 puntos consistente en agentes autónomos de código, algo crítico para herramientas como Claude Code.
  • Ecosistema y tooling. SDKs maduros, integraciones con IDEs, MCP, guardrails oficiales y soporte empresarial 24/7.
  • Auditoría y datasheet. Anthropic y OpenAI publican tarjetas de modelo detalladas y datasheets para cumplimiento normativo europeo.
  • Sin sesgo geopolítico explícito. Los frontier occidentales no aplican censura sobre temas críticos del PCCh, algo relevante para medios, ONG y contenidos regulados.

Riesgos de privacidad y jurisdicción china

Consumir un modelo chino no es una decisión neutra. Tres frentes que conviene decidir antes de mover una sola carga a producción.

Residencia de datos

La API oficial de Moonshot procesa peticiones en centros de datos ubicados en China continental y Hong Kong. Aplica por defecto la Cybersecurity Law de 2017 y la Personal Information Protection Law de 2021. Para datos sensibles bajo el RGPD europeo, la vía correcta es desplegar los pesos en infraestructura propia dentro del EEE o consumir el modelo vía intermediario serverless con contrato europeo.

Sesgo político y censura

Ambos modelos aplican filtros de contenido sobre temas sensibles en su jurisdicción de origen: Tiananmen 1989, Taiwan, Tíbet, Uigures y la figura de Xi Jinping. En pruebas reproducibles publicadas por investigadores de EleutherAI el 20 de julio, Kimi K3 rechaza responder o produce respuestas neutras. En tareas técnicas y creativas neutras el efecto es imperceptible, pero conviene documentar el sesgo si el modelo se expone a usuarios finales.

Trazabilidad del corpus

Ni Moonshot ni Alibaba publican datasheet detallada del corpus de entrenamiento. Para sistemas de alto riesgo bajo la EU AI Act, es un obstáculo formal serio. Recomendación: capa de guardrails propia y filtros de output antes de exponer el modelo a público final.

Recomendación: para datos sensibles evita la API oficial china; despliega los pesos on-premise o usa un proveedor serverless con contrato europeo. Añade siempre auditoría de output y trazabilidad de prompts.

Impacto geopolítico EEUU-China

Kimi K3 y Qwen 3.8 Max no llegan en el vacío. La administración Trump ha revisado las Export Administration Regulations para incluir modelos frontier en la lista de tecnologías de doble uso; OpenAI aceptó restricciones que dejan a GPT-5.6 Sol fuera del alcance europeo hasta que se negocie una excepción. Anthropic reabrió Fable en Europa hace un par de semanas tras negociar con la Casa Blanca, pero el precedente ha marcado a toda la industria: la política puede cerrar el acceso a un frontier occidental en días, mientras los pesos de Kimi K3 estarán en HuggingFace para siempre.

Tres consecuencias inmediatas para el mercado europeo:

  • Presión bajista sobre precios. Con Kimi K3 en 0,60 dólares por millón de tokens de output, sostener 15 dólares es difícil salvo en workloads sensibles a calidad marginal.
  • Fragmentación regulatoria. Europa se encuentra con un frontier chino open source desplegable dentro del EEE, lo que abre debates sobre soberanía digital, residencia de datos y auditoría.
  • Aceleración del silicio nacional chino. El entrenamiento de Kimi K3 combina H100 con Ascend 910C. Las sanciones han empujado a Huawei y SMIC a madurar más rápido. En 2027 esperamos frontier chinos entrenados ya al 100 % en silicio doméstico.
Concept art de dos bloques tecnológicos globales compitiendo por el liderazgo en inteligencia artificial frontier
La era multipolar de la IA frontier ya no es un pronóstico: es la fotografía de julio de 2026

Formación para entender la ola

Si quieres reconstruir la base conceptual para opinar con criterio sobre esta ola, tres lecturas de cabecera imprescindibles:

Conclusión: el frontier open source es plural y chino

Kimi K3 y Qwen 3.8 Max cierran una fotografía contundente en julio de 2026: cuatro laboratorios chinos compiten de tú a tú con Claude Fable 5 y GPT-5.6 Sol, con pesos abiertos, contexto ultra-largo y precios que tambalean los márgenes del sector. Para el desarrollador español, más opciones y menos coste. Para Washington, un aviso sin ambigüedad. La era multipolar de la IA frontier ha llegado con acento chino.

Preguntas frecuentes

¿Cuándo se puede descargar Kimi K3 gratis?

Moonshot AI ha confirmado la liberación de los pesos a finales de julio de 2026 en HuggingFace y ModelScope bajo licencia derivada de Apache 2.0. La descarga será gratuita para desarrolladores de cualquier país, sin registro empresarial ni firma de acuerdos previos.

¿Qué significan los 2,8 billones de parámetros de Kimi K3?

2,8 billones en notación española equivale a 2,8 × 10¹² parámetros (2,8 trillion en inglés). Es la escala total del modelo, con una arquitectura Mixture-of-Experts que activa solo unos 64.000 millones por token, lo que mantiene el coste de inferencia asequible pese al tamaño.

¿Es verdad que solo Claude Fable 5 supera a Qwen 3.8 Max?

En los benchmarks publicados por Alibaba y las primeras verificaciones independientes, Qwen 3.8 Max empata prácticamente con GPT-5.6 Sol y Gemini 3.5 Pro y se queda a décimas de Claude Fable 5. La afirmación es técnicamente sostenible en la mayoría de tests estándar, aunque la ventaja de Fable sigue siendo consistente en SWE-bench y agentes autónomos.

¿Cuánto cuesta usar Kimi K3 comparado con Claude Fable 5?

Kimi K3 costará 0,15 dólares por millón de tokens de input y 0,60 dólares por millón de output. Claude Fable 5 cobra 3,00 y 15,00 respectivamente. Kimi K3 es 25 veces más barato en output, la mayor brecha jamás registrada entre dos modelos con benchmarks comparables.

¿Puedo ejecutar Kimi K3 en un PC de escritorio?

El modelo completo no; hacen falta al menos 8 GPUs H100 o clústeres equivalentes. Sin embargo, la comunidad publicará variantes destiladas en el rango 7B-32B ejecutables en una RTX 5090 con 32 GB de VRAM, y para prototipado ligero un Mac Mini M4 mueve las cuantizaciones Q4.

¿Es seguro usar Kimi K3 o Qwen 3.8 Max desde España?

La API oficial de ambos procesa peticiones en servidores chinos y aplica la Cybersecurity Law y la PIPL china. Para datos sensibles bajo el RGPD conviene desplegar los pesos en infraestructura propia dentro del EEE o consumir el modelo vía proveedor serverless (Together, Fireworks, OpenRouter) con contrato europeo.

¿Tienen sesgo político Kimi K3 y Qwen 3.8 Max?

Sí. Ambos aplican filtros de contenido sobre temas políticamente sensibles en China (Tiananmen 1989, Taiwan, Tíbet, Uigures, la figura de Xi Jinping). Para tareas técnicas o creativas neutras el efecto es imperceptible, pero conviene documentar el sesgo si el modelo se expone a usuarios finales o cubre contenido político.

¿Cómo se comparan con GLM-5.2 y DeepSeek V4?

Los cuatro modelos están en el mismo rango de calidad. Kimi K3 lidera en escala, contexto y precio; Qwen 3.8 Max tiene el mejor ecosistema empresarial y multilingüe; GLM-5.2 es el más ligero para desplegar en local; DeepSeek V4 mantiene su ventaja en código puro. Cada vez más equipos montan arquitecturas híbridas combinando varios según el tipo de tarea.

Aviso: este artículo incluye enlaces de afiliado de Amazon. Si compras a través de ellos, Arkaia recibe una pequeña comisión sin coste adicional para ti. Los precios y la disponibilidad pueden variar; consulta siempre la ficha actualizada en Amazon antes de comprar.

Compartir:

Comentarios

Cargando comentarios...