Estructura cristalina geométrica translúcida atravesada por trazos de luz azul sobre fondo negro
Volver al blog
TUTORIALES 27 Agosto 2026 11 min lectura 12 visitas

Granite 4.2: cómo ejecutar los modelos de IBM en local paso a paso

Chester
Chester Editor

Granite 4.2 es la familia de modelos que IBM liberó el 25 de agosto de 2026 y que cambia bastante el panorama de la IA en local: tres tamaños (3B, 8B y 30B), licencia Apache 2.0 sin letra pequeña, 128.000 tokens de contexto en todos ellos y un modo de razonamiento que se puede activar y desactivar. Lo interesante no es el tamaño, sino que los dos modelos grandes pasaron por entrenamiento por refuerzo dentro de entornos reales de programación, terminal y búsqueda web. Esta guía te lleva de cero a tenerlo funcionando en tu equipo, con los requisitos reales de memoria y qué esperar de cada tamaño.

Resumen rápido: Granite 4.2 llegó el 25 de agosto de 2026 en tamaños de 3B, 8B y 30B parámetros, con licencia Apache 2.0 —uso comercial incluido— y 128.000 tokens de contexto. Están entrenados desde cero sobre unos 15 billones de tokens. Se instalan con un comando en Ollama y hay cuantizaciones GGUF hasta Q4_K_M, así que el de 8B corre en cualquier equipo con 16 GB de RAM sin necesidad de tarjeta gráfica dedicada. El 30B alcanza 57,00 en SWE-Bench Verified y 89,17 en AIME25, cifras impensables en un modelo abierto que cabe en un ordenador de casa.

Qué es Granite 4.2 y por qué importa

Granite 4.2 es la primera familia de IBM de modelos de razonamiento densos y decoder-only. Tres detalles la separan del ruido habitual de lanzamientos:

  • Licencia Apache 2.0 de verdad. No es una licencia «abierta pero» con restricciones de uso comercial o de número de usuarios. Puedes usarlo en un producto y no dar explicaciones.
  • Modo de razonamiento conmutable. El mismo modelo puede responder directo o pensar paso a paso antes de contestar, según lo que necesites. Pensar cuesta tokens y tiempo, así que poder apagarlo importa.
  • Entrenamiento por refuerzo agéntico. Los modelos de 8B y 30B aprendieron editando código, manejando una terminal y haciendo búsquedas web dentro de entornos aislados reales. No es capacidad simulada con datos sintéticos: es entrenamiento sobre la tarea.

El reparto de los datos de entrenamiento lo dice todo sobre su enfoque: un 31,6 % de datos agénticos, y de esos, un 69 % de ingeniería de software. Es un modelo pensado para trabajar, no para conversar.

Terminal de ordenador mostrando líneas de texto desenfocadas durante la ejecución de un modelo de lenguaje en local
Con Ollama, tener Granite 4.2 funcionando en local es cuestión de dos comandos.

Los números: qué rinde cada tamaño

Estos son los resultados publicados por IBM, y conviene mirarlos con cuidado porque explican para qué sirve cada tamaño:

BenchmarkQué mide3B8B30B
SWE-Bench VerifiedResolver issues reales de GitHub47,6757,00
Terminal-Bench 2.1Manejo de terminal20,5629,24
AIME25Matemáticas de competición78,3386,6789,17
MMLU-ProConocimiento general avanzado67,8474,0477,60
GPQAPreguntas científicas de posgrado54,8064,1466,41
τ³-benchUso de herramientas50,9966,3468,05
BFCL v4Llamada a funciones52,4150,2961,39
RULER 128KUso real del contexto largo55,3071,4181,38

Dos lecturas que no son obvias. La primera: el 3B no recibió entrenamiento agéntico, solo alineación y refuerzo básico, y por eso no aparece en SWE-Bench ni Terminal-Bench. Si tu caso de uso son agentes o programación, el 3B no es una versión pequeña del 8B: es otra cosa.

La segunda es RULER 128K, el benchmark más honesto de la tabla. Mide si el modelo usa de verdad su contexto largo o si solo lo acepta sin aprovecharlo. El salto de 55,30 en el 3B a 81,38 en el 30B explica por qué, para documentos largos, el tamaño importa mucho más de lo que sugieren los otros números.

Requisitos previos: RAM y VRAM reales

Aquí es donde la mayoría de guías mienten por optimismo. Estas son las cifras con las que la cosa funciona de verdad, usando cuantización GGUF Q4_K_M, que es la que descarga Ollama por defecto:

ModeloTamaño en discoRAM mínimaRAM cómodaCon GPU
Granite 4.2 3B~2 GB8 GB16 GB4 GB VRAM
Granite 4.2 8B~5 GB16 GB32 GB8 GB VRAM
Granite 4.2 30B~18 GB32 GB64 GB24 GB VRAM

El contexto también ocupa memoria, y mucho. Las cifras de arriba son para cargar el modelo. Si además usas ventanas de contexto largas, la caché KV se suma: con 128.000 tokens puede añadir varios gigabytes. Es la razón número uno de que un modelo que «cabía» empiece a dar errores de memoria en cuanto le pasas un documento largo.

No hace falta tarjeta gráfica: los modelos corren en CPU perfectamente, solo que más despacio. Un mini PC con 32 GB mueve el 8B con soltura, como detallamos en la guía de mejores mini PC. Si quieres velocidad, la GPU manda: tienes las opciones en mejores GPU para IA en local.

Paso 1: instalar Ollama

Ollama es la forma más simple de ejecutar modelos en local: se encarga de la descarga, la cuantización y de servir una API compatible. En Linux y macOS:

curl -fsSL https://ollama.com/install.sh | sh

En Windows, descarga el instalador desde la web oficial. Comprueba que ha quedado bien con:

ollama --version

Si vienes de cero con Ollama y quieres entender bien la herramienta antes de seguir, tenemos la guía completa de Ollama con toda su configuración.

Paso 2: descargar el modelo adecuado

Un solo comando. Elige el tamaño según la tabla de requisitos:

ollama pull granite4.2:3b     # ligero, sin capacidades agenticas
ollama pull granite4.2:8b     # el equilibrio recomendado
ollama pull granite4.2:30b    # maximo rendimiento, 32 GB o mas

Nuestra recomendación: empieza por el 8B. Es el que ofrece capacidades agénticas reales con unos requisitos razonables, y baja al 3B solo si tu equipo no da para más. El 30B tiene sentido si vas a hacer trabajo serio de programación asistida y tienes 32 GB o más.

Paso 3: primera conversación y modo razonamiento

Para hablar con él directamente:

ollama run granite4.2:8b

Y aquí llega la característica que más partido da. El modo de razonamiento es conmutable: con él activado, el modelo piensa paso a paso antes de responder, lo que mejora bastante los resultados en matemáticas, lógica y programación, a costa de más tokens y más tiempo. Con él desactivado, responde directo.

La regla práctica es sencilla: actívalo para problemas que requieren varios pasos y desactívalo para tareas directas como resumir, clasificar o extraer datos. Dejarlo siempre activo multiplica el coste en tiempo sin mejorar nada en tareas simples.

Paso 4: usarlo desde tu código por API

Ollama levanta un servidor HTTP en localhost:11434, así que puedes llamarlo desde cualquier lenguaje sin instalar librerías:

import json, urllib.request

cuerpo = json.dumps({
    "model": "granite4.2:8b",
    "prompt": "Resume este texto en tres puntos: ...",
    "stream": False,
}).encode()

req = urllib.request.Request(
    "http://localhost:11434/api/generate",
    data=cuerpo,
    headers={"Content-Type": "application/json"},
)
respuesta = json.loads(urllib.request.urlopen(req).read())
print(respuesta["response"])

Si necesitas mantener una conversación con historial, usa el endpoint /api/chat pasando la lista de mensajes en vez de un prompt suelto. Y como el servidor escucha por HTTP, puedes exponerlo a tu red local y llamarlo desde otro equipo, igual que hacemos con ComfyUI en la guía de generación de imágenes en local.

Equipo de sobremesa con tarjeta gráfica visible funcionando en una habitación en penumbra
Sin GPU los modelos funcionan igual, solo que más despacio: la tarjeta gráfica multiplica la velocidad de generación.

Paso 5: aprovechar los 128K de contexto

Los 128.000 tokens de contexto equivalen, muy a ojo, a unas 300 páginas de texto. Eso permite cosas que antes obligaban a montar un sistema de búsqueda documental completo: pasarle un manual entero, un repositorio pequeño o meses de registros y preguntar sobre ello directamente.

Pero hay que activarlo, porque Ollama no usa la ventana completa por defecto: arranca con un contexto mucho menor para ahorrar memoria. Dentro de la sesión interactiva:

/set parameter num_ctx 131072

Y desde la API, pasando options en la petición:

{"model": "granite4.2:8b", "prompt": "...", "options": {"num_ctx": 131072}}

Ojo con el consumo: subir el contexto al máximo puede añadir varios gigabytes de memoria. Sube en escalones —16K, 32K, 64K— hasta donde tu equipo aguante, en vez de saltar directamente al máximo.

Errores comunes y cómo resolverlos

«Model requires more system memory»

El modelo no cabe. Baja un tamaño (de 30B a 8B, o de 8B a 3B) o reduce num_ctx. Si acabas de subir el contexto y ha empezado a fallar, es la caché KV: ese es el culpable, no el modelo.

Va lentísimo aunque tengo tarjeta gráfica

Comprueba que Ollama la está usando de verdad. Ejecuta ollama ps con el modelo cargado: te dirá qué porcentaje está en GPU y cuánto en CPU. Si ves 100 % CPU, faltan los drivers o el modelo no cabe entero en la VRAM y ha hecho offload.

Responde en inglés aunque le escribo en español

Indícaselo explícitamente en el mensaje de sistema. Es un comportamiento habitual en modelos entrenados mayoritariamente en inglés y se corrige con una instrucción clara del tipo «responde siempre en español».

Ocupa mucho disco y quiero limpiar

Lista lo que tienes con ollama list y borra lo que no uses con ollama rm granite4.2:30b. Es fácil acumular decenas de gigabytes probando modelos sin darse cuenta.

Material recomendado para IA en local

Lo que de verdad condiciona la experiencia es la memoria, en este orden: primero la VRAM de la gráfica, y cuando no hay o no basta, la RAM del sistema.

Si vas a montar o ampliar un equipo, un kit de 32 GB DDR5 a 6000 CL30 es el mínimo razonable para trabajar con el 8B con holgura, y los 64 GB en kit de 2×32 son lo que necesitas para el 30B con contexto largo. Tienes el resto de opciones en la comparativa de mejores memorias RAM DDR5.

En gráficas, el salto que más se nota es llegar a 16 GB de VRAM: la ASUS Dual RTX 5060 Ti de 16 GB es la forma más barata de conseguirlos, y la Gigabyte RTX 5070 Ti de 16 GB añade bastante velocidad. Si prefieres un equipo compacto y silencioso encendido todo el día, el Beelink SER8 con 32 GB o el Mac Mini M4 mueven el 8B sin ventiladores desbocados.

Y no subestimes el disco: entre varios modelos se acumulan decenas de gigabytes y cada carga lee el archivo entero. Un WD_BLACK SN850X de 2 TB o el Samsung 990 EVO Plus de 2 TB cumplen de sobra. Ver precio actual en Amazon en cada enlace.

Preguntas frecuentes sobre Granite 4.2

¿Qué es Granite 4.2?

Granite 4.2 es la familia de modelos de lenguaje que IBM liberó el 25 de agosto de 2026 en tamaños de 3B, 8B y 30B parámetros, bajo licencia Apache 2.0 y con 128.000 tokens de contexto. Son modelos densos decoder-only entrenados desde cero sobre unos 15 billones de tokens, con modo de razonamiento conmutable y capacidades agénticas en los dos tamaños mayores.

¿Granite 4.2 es gratis y se puede usar comercialmente?

Sí. Los pesos están publicados bajo licencia Apache 2.0, que permite uso comercial, modificación y redistribución sin pagar nada ni pedir permiso. Es una licencia abierta de verdad, no una «abierta con condiciones» como las que restringen el número de usuarios o el uso en productos.

¿Cuánta RAM necesito para ejecutar Granite 4.2?

Con cuantización Q4_K_M, el modelo de 3B necesita unos 8 GB de RAM, el de 8B unos 16 GB y el de 30B unos 32 GB. Esas cifras son solo para cargar el modelo: si usas ventanas de contexto largas, la caché KV puede añadir varios gigabytes más, así que conviene ir con margen.

¿Qué tamaño de Granite 4.2 debo elegir?

El de 8B para la mayoría: es el más pequeño que incluye entrenamiento agéntico y ofrece capacidades reales de programación y uso de herramientas con requisitos razonables. El 3B solo si tu equipo no da para más, teniendo en cuenta que no recibió entrenamiento agéntico. El 30B si vas a hacer trabajo serio de programación asistida y tienes 32 GB de RAM o más.

¿Necesito tarjeta gráfica para usar Granite 4.2?

No, funciona en CPU perfectamente, solo que más despacio. Un equipo con 16 GB de RAM mueve el modelo de 8B a una velocidad usable sin ninguna gráfica dedicada. Si quieres velocidad de generación alta, entonces sí conviene una GPU: el salto más rentable es llegar a 16 GB de VRAM.

¿Cómo se instala Granite 4.2 con Ollama?

Instala Ollama con curl -fsSL https://ollama.com/install.sh | sh en Linux o macOS, o con el instalador oficial en Windows. Después descarga el modelo con ollama pull granite4.2:8b y arráncalo con ollama run granite4.2:8b. Ollama se encarga de la cuantización y de servir la API en localhost:11434.

¿Qué es el modo de razonamiento conmutable?

Es la capacidad de activar o desactivar el pensamiento paso a paso antes de responder. Con el razonamiento activo, el modelo mejora bastante en matemáticas, lógica y programación, pero consume más tokens y tarda más. Conviene activarlo para problemas de varios pasos y desactivarlo para tareas directas como resumir, clasificar o extraer datos.

¿Por qué mi Granite 4.2 no usa los 128K de contexto?

Porque Ollama arranca con una ventana de contexto mucho menor para ahorrar memoria, y hay que subirla a mano. En la sesión interactiva se hace con /set parameter num_ctx 131072, y desde la API pasando options con num_ctx en la petición. Súbelo en escalones, porque la caché KV puede añadir varios gigabytes de consumo.

Conclusión

Granite 4.2 es de los lanzamientos más interesantes del año para quien trabaja con IA en local, y no por los benchmarks sino por la combinación: Apache 2.0 real, 128K de contexto y entrenamiento agéntico en modelos que caben en un ordenador de casa. Que un 8B resuelva casi la mitad de SWE-Bench Verified habría sonado a exageración hace un año.

Si vas a probarlo, empieza por el 8B con Ollama, activa el razonamiento solo cuando el problema lo pida, y sube el contexto en escalones vigilando la memoria. Con esas tres cosas claras, en diez minutos tienes un modelo capaz corriendo sin enviar un solo dato fuera de tu equipo.

Este artículo contiene enlaces afiliados a Amazon con el tag webmasteroson-21. Si compras a través de estos enlaces, Arkaia puede recibir una comisión sin coste adicional para ti. Nuestra valoración editorial es independiente y no varía según los ingresos por afiliación.

Compartir:

Comentarios

Cargando comentarios...