La pregunta que más nos hacéis sobre inteligencia artificial en local no es qué modelo es mejor, sino qué modelo cabe en tu tarjeta gráfica. Y tiene respuesta con números. En esta guía te explicamos cómo calcular cuánta memoria de vídeo necesita un modelo, qué modelos puedes ejecutar con 8, 12, 16, 24 y 32 GB de VRAM, y qué tarjeta comprar si vas a montar un equipo para IA local. Con una diferencia respecto a otras guías: parte de las cifras no son estimaciones, sino mediciones reales del servidor con una RTX 5060 Ti de 16 GB donde funcionan los asistentes de Arkaia.
La regla rápida: cuánta memoria ocupa un modelo
Para ejecutar un modelo de lenguaje, la tarjeta gráfica tiene que guardar en su memoria dos cosas: los pesos del modelo y el contexto, es decir, la conversación o el documento con el que está trabajando.
Los pesos se calculan con una cuenta sencilla: número de parámetros multiplicado por los bits que ocupa cada uno. Un modelo sin comprimir usa 16 bits por parámetro, pero para uso local casi siempre se usan versiones cuantizadas, comprimidas a 8, 4 o incluso 3 bits, con una pérdida de calidad que en 4 bits suele ser pequeña.
| Tamaño del modelo | 16 bits (sin comprimir) | 8 bits | 4 bits |
|---|---|---|---|
| 8-9B | ~16-18 GB | ~8-9 GB | ~5-6 GB |
| 14B | ~28 GB | ~14-15 GB | ~8-9 GB |
| 27-32B | ~54-64 GB | ~28-34 GB | ~16-20 GB |
| 70B | ~140 GB | ~70-75 GB | ~40-42 GB |
A esa cifra hay que sumarle el contexto, que crece con la longitud de la conversación, y un pequeño margen para el propio sistema. La regla práctica: deja al menos 1,5-2 GB libres por encima del tamaño del modelo para una conversación normal, y bastante más si vas a trabajar con documentos largos.
Nuestras mediciones reales en una tarjeta de 16 GB
En Arkaia ejecutamos modelos locales para los asistentes de nuestro servidor de Discord, sobre una NVIDIA GeForce RTX 5060 Ti de 16 GB con Ollama. Estas son las cifras que hemos medido nosotros, no las de una ficha técnica:
| Modelo | Parámetros | Cuantización | Ocupa | ¿Cabe en 16 GB? |
|---|---|---|---|---|
| Qwen 3.5 9B | 9,7B | 4 bits (Q4_K_M) | 6,6 GB | Sí, con muchísimo margen |
| Qwen 3 14B | 14B | 4 bits | ~10,5 GB cargado | Sí, con margen |
| Gemma 4 MoE 26B | 25,2B | 3 bits (Q3_K_M) | 13,5 GB en VRAM con 8.192 de contexto | Sí, justo |
| Qwen 3.8 27B | 27,3B | 4 bits (Q4_K_M) | 17 GB | No |
La última fila es la lección más útil de toda la tabla. Qwen 3.8 27B, el mismo modelo que usa el agente local de Perplexity, ocupa 17 GB en su versión de 4 bits y no cabe en una tarjeta de 16 GB. Probamos a usarlo como modelo principal y tuvimos que cambiarlo. La solución fue Gemma 4 MoE de 26B comprimido a 3 bits: 13,5 GB, con margen suficiente para el contexto de 8.192 tokens que usan nuestros asistentes.
Hay un detalle que no aparece en ninguna tabla: cuando un modelo no cabe entero en la GPU, herramientas como Ollama reparten una parte en la memoria del sistema y el procesador. Funciona, pero sin avisar: el modelo simplemente va mucho más lento. Nos pasó con los asistentes, que seguían respondiendo pero con una lentitud desesperante, y no había ningún error en los registros que lo explicara.
Qué es un modelo MoE y por qué te importa
Gemma 4 MoE es un modelo de «mezcla de expertos». En lugar de usar todos sus parámetros para cada palabra que genera, activa solo una parte de ellos. Eso tiene dos consecuencias prácticas para quien ejecuta en local:
- Va más rápido que un modelo denso del mismo tamaño, porque cada paso mueve menos cálculos.
- Ocupa lo mismo en memoria que un modelo denso de su tamaño total, porque todos los expertos tienen que estar cargados.
En otras palabras: un MoE no te ahorra VRAM, pero te da más velocidad con la VRAM que tienes. Para una tarjeta de 16 GB es la mejor forma de acercarse a la calidad de un modelo de 27 o 30B sin quedarte fuera por unos pocos gigas.
Con 8 GB de VRAM
Es la memoria de muchas tarjetas de gama de entrada, como la RTX 5060 de 8 GB. Da para modelos de 7 a 9B comprimidos a 4 bits, que ocupan unos 5-6 GB y dejan margen para el contexto.
- Qué puedes ejecutar: modelos de 7-9B a 4 bits. En nuestras mediciones, Qwen 3.5 9B ocupa 6,6 GB.
- Para qué sirve: chat general, resúmenes, ayuda con textos cortos y código sencillo.
- Límite: contextos largos o modelos de 14B ya no caben enteros.
Si tienes una de estas tarjetas, no necesitas cambiarla para empezar: es suficiente para probar la IA local con Ollama. Si vas a comprar, en cambio, 8 GB es poco para la IA local de 2026.
- MSI GeForce RTX 5060 8G Shadow 2X OC. Ver precio actual en Amazon
Con 12 GB de VRAM
Es el punto de la RTX 5070 de 12 GB. Permite modelos de 9B con más calidad, a 8 bits, o modelos de 14B a 4 bits, que en nuestras pruebas ocupan unos 10,5 GB cargados.
- Qué puedes ejecutar: modelos de 14B a 4 bits, o de 7-9B a 8 bits.
- Para qué sirve: asistentes de uso diario con buena calidad, programación y análisis de documentos medianos.
- Límite: los modelos de 20B o más no caben.
La RTX 5070 es una tarjeta excelente para jugar, pero para IA local sus 12 GB se quedan a medio camino: si la IA es tu prioridad, a igualdad de presupuesto compensa más una tarjeta de 16 GB.
- GIGABYTE GeForce RTX 5070 Gaming OC 12G. Ver precio actual en Amazon
Con 16 GB de VRAM: el punto dulce
Es la memoria de nuestra RTX 5060 Ti y, en nuestra opinión, la mejor relación entre precio y capacidad para IA local en 2026. Da para modelos de 14B con mucho margen y para modelos MoE de unos 26B comprimidos a 3 bits, como el Gemma 4 MoE que usamos a diario.
- Qué puedes ejecutar: 14B con contexto largo, MoE de ~26B a 3 bits (13,5 GB medidos).
- Para qué sirve: asistentes de calidad alta, programación seria, trabajo con documentos y, fuera de los modelos de texto, generación de imágenes con modelos como FLUX.
- Límite: los modelos densos de 27B a 4 bits no caben: Qwen 3.8 27B pide 17 GB.
La RTX 5060 Ti de 16 GB es la tarjeta más barata de NVIDIA con esta memoria, y es la que recomendamos a casi todo el mundo que quiere IA local sin gastar lo que cuesta una gama alta.
- MSI GeForce RTX 5060 Ti 16G Shadow 2X OC Plus. Ver precio actual en Amazon
- ASUS Dual GeForce RTX 5060 Ti 16 GB OC Edition. Ver precio actual en Amazon
- MSI GeForce RTX 5070 Ti 16G Shadow 3X OC, la misma memoria con mucha más potencia si también juegas a resolución alta. Ver precio actual en Amazon
¿Y AMD? La Radeon RX 9060 XT de 16 GB tiene la misma memoria a buen precio, pero la IA local en tarjetas AMD depende de ROCm, que funciona mejor en Linux que en Windows y tiene menos compatibilidad con algunas herramientas. Lo analizamos en nuestra review de la RX 9060 XT de 16 GB. Si quieres cero complicaciones, NVIDIA.
Con 24 GB de VRAM
Aquí entran los modelos densos de 27 a 32B a 4 bits, que ocupan unos 16-20 GB, con margen para el contexto. Es la memoria que exige, por ejemplo, el agente local de Perplexity, que funciona con Qwen 3.8 27B, como contamos en nuestro artículo sobre Perplexity Portable Computer.
- Qué puedes ejecutar: modelos de 27-32B a 4 bits con contexto amplio.
- Para qué sirve: agentes locales, programación compleja y razonamiento de calidad cercana a los grandes servicios en la nube.
- Límite: los modelos de 70B no caben en una sola tarjeta.
En la gama GeForce actual no hay ninguna tarjeta nueva con exactamente 24 GB: la RTX 4090 está descatalogada y queda poco stock, y la RTX 3090 se encuentra sobre todo de segunda mano.
- ASUS TUF Gaming GeForce RTX 4090 de 24 GB. Ver precio actual en Amazon
Con 32 GB de VRAM
Es la memoria de la RTX 5090, la única GeForce actual que la tiene. Da para modelos de 27-32B con compresiones de mayor calidad o con contextos muy largos, y deja margen para usar modelos de texto e imagen a la vez.
- MSI GeForce RTX 5090 32G Ventus 3X OC. Ver precio actual en Amazon
Ni siquiera con 32 GB cabe un modelo de 70B a 4 bits, que pide unos 40 GB. Para esos modelos hay que ir a dos tarjetas, a estaciones profesionales o a equipos con memoria unificada, que repasamos en nuestra guía de portátiles para IA local.
Resumen: qué cabe en cada tarjeta
| VRAM | Tarjeta de ejemplo | Modelo más grande cómodo | Uso ideal |
|---|---|---|---|
| 8 GB | RTX 5060 | 7-9B a 4 bits | Probar la IA local, chat sencillo |
| 12 GB | RTX 5070 | 14B a 4 bits | Asistente diario, código |
| 16 GB | RTX 5060 Ti / 5070 Ti | 14B holgado, MoE 26B a 3 bits | El punto dulce calidad-precio |
| 24 GB | RTX 4090 / 3090 | 27-32B a 4 bits | Agentes locales, código complejo |
| 32 GB | RTX 5090 | 27-32B con alta calidad | Sin compromisos |
Cómo comprobar que un modelo cabe entero en la GPU
La lentitud silenciosa que te contábamos antes tiene diagnóstico sencillo. Con Ollama, el comando ollama ps muestra los modelos cargados y, en la columna del procesador, qué parte de cada uno está en la GPU y qué parte en la CPU.
ollama ps
- Si ves 100 % GPU, el modelo cabe entero y va a la máxima velocidad que permite tu tarjeta.
- Si ves un reparto entre CPU y GPU, una parte del modelo está en la memoria del sistema. Funcionará, pero mucho más despacio. La solución es usar una versión más comprimida, un modelo más pequeño o reducir el contexto.
Es la comprobación que nos habría ahorrado horas cuando nuestros asistentes empezaron a ir lentos sin motivo aparente. Hazla siempre después de cambiar de modelo o de ampliar el contexto.
Texto e imágenes a la vez: otra cuenta que hacer
Si además de un asistente de texto quieres generar imágenes en local, la VRAM se reparte entre los dos. En nuestro servidor, el modelo de imágenes FLUX.2 Klein ocupa unos 12,5 GB cuando está cargado en ComfyUI. Sumado a los 13,5 GB del modelo de texto, no caben juntos en una tarjeta de 16 GB.
Nuestra solución es un turno: el modelo de texto está siempre cargado para los asistentes y, cuando hay que generar imágenes, se descarga, se genera la tanda entera y se vuelve a cargar. Funciona bien porque las imágenes se generan en tandas cortas. Si tu idea es usar texto e imagen continuamente y a la vez, necesitas una tarjeta de 24 o 32 GB, o dos tarjetas.
No te olvides de la memoria RAM
La VRAM manda, pero la RAM del sistema también cuenta. Ollama carga el modelo pasando por la memoria del ordenador, y si el modelo no cabe entero en la GPU, lo que sobra se queda en la RAM. Además, mientras la IA trabaja, sigues usando el navegador y otras aplicaciones.
Nuestra recomendación mínima es 32 GB de RAM para un equipo de IA local con una tarjeta de 16 GB, y 64 GB si vas a una de 24 o 32 GB. Tienes más opciones en nuestra guía de las mejores memorias DDR5.
- Patriot Viper Venom DDR5 de 32 GB (2 × 16 GB) a 6000 MT/s CL30. Ver precio actual en Amazon
- Crucial Pro DDR5 de 32 GB (2 × 16 GB) a 6000 MHz. Ver precio actual en Amazon
Si compras una tarjeta de segunda mano
Para IA local, el mercado de segunda mano es muy atractivo: una RTX 3090 usada es la forma más barata de tener 24 GB de VRAM. Pero conviene comprobar varias cosas antes de pagar:
- Uso anterior. Pregunta si la tarjeta se ha usado para minar criptomonedas o para entrenar modelos las 24 horas. No es un motivo automático para descartarla, pero sí para pedir un precio más bajo y revisar bien la temperatura.
- Temperaturas y ventiladores. Pide una prueba de carga o un vídeo con la tarjeta funcionando. Ventiladores ruidosos o temperaturas muy altas suelen indicar pasta térmica seca o almohadillas desgastadas.
- Garantía. Algunos fabricantes mantienen la garantía con la factura original aunque cambie el dueño. Pide la factura.
- Consumo y fuente. Las tarjetas de gama alta de generaciones anteriores consumen mucho. Comprueba que tu fuente de alimentación tiene la potencia y los conectores necesarios antes de comprar.
- Tamaño. Mide el hueco de tu caja: muchas tarjetas de gama alta tienen tres ranuras de grosor y más de 30 cm de largo.
Si dudas entre una tarjeta nueva de 16 GB y una usada de 24 GB, piensa en qué modelos quieres ejecutar: si te bastan los de 14B o los MoE comprimidos, la nueva te da garantía y menos consumo; si necesitas modelos densos de 27B, solo la de 24 GB te sirve.
Cómo empezar hoy con lo que tienes
- Mira cuánta VRAM tiene tu tarjeta. En Windows, en el Administrador de tareas, pestaña Rendimiento, apartado GPU: la cifra de «memoria de GPU dedicada» es la que importa.
- Instala Ollama. Es gratuito y se instala en minutos. Tienes el paso a paso en nuestra guía de Ollama.
- Empieza por un modelo pequeño. Uno de 7-9B funciona en casi cualquier tarjeta moderna y te da una idea de la velocidad.
- Sube de tamaño hasta que notes que se ralentiza. Ese es tu límite real: si un modelo empieza a ir mucho más lento, probablemente ya no cabe entero en la GPU.
- Cierra lo que use la GPU. Un juego abierto o un editor de vídeo ocupan VRAM que el modelo necesita.
¿No tienes tarjeta gráfica? Hay alternativas: los modelos pequeños funcionan solo con el procesador, más despacio, y tenemos un tutorial para ejecutar modelos grandes en un portátil sin GPU.
Qué modelo elegir dentro de tu tamaño
Saber qué cabe es la mitad de la decisión. La otra mitad es elegir bien entre los modelos de ese tamaño, porque la calidad varía mucho según la tarea. Tres criterios prácticos:
- Idioma. Si vas a usarlo en español, prueba varios: no todos lo manejan igual de bien, y los de familias con mucho entrenamiento multilingüe suelen responder de forma más natural.
- Tarea. Hay modelos pensados para programación y otros para conversación general. Un modelo de código de 14B puede superar a uno general más grande en esa tarea concreta.
- Razonamiento. Algunos modelos «piensan» antes de responder. Dan mejores respuestas en problemas difíciles, pero tardan más y consumen más contexto. Para un asistente rápido, conviene desactivar ese modo si el modelo lo permite.
Tienes un repaso completo de los modelos abiertos del momento, con sus puntos fuertes, en nuestra comparativa de los mejores modelos de IA open source.
Conclusión
La memoria de vídeo es la cifra que decide qué inteligencia artificial puedes ejecutar en casa. Con 8 GB, modelos de 7-9B; con 12 GB, de 14B; con 16 GB, el punto dulce, 14B con holgura y MoE de unos 26B comprimidos; con 24 GB, modelos densos de 27-32B; y con 32 GB, esos mismos con más calidad y contexto. Por encima, los 70B necesitan más de una tarjeta.
Si vas a comprar pensando en la IA local, nuestra recomendación es clara: una tarjeta de 16 GB, idealmente la RTX 5060 Ti por precio, y 32 GB de RAM. Es exactamente lo que usamos en nuestro servidor, y lo que nos ha enseñado que unos pocos gigas de diferencia, 13,5 frente a 17, deciden si un modelo vuela o se arrastra.
Preguntas Frecuentes
¿Cuánta VRAM necesito para IA local?
Para empezar, 8 GB bastan con modelos de 7-9B. Para un uso serio recomendamos 16 GB, que permite modelos de 14B con holgura y MoE de unos 26B comprimidos. Con 24 GB caben modelos densos de 27-32B.
¿Cabe Qwen 3.8 27B en una tarjeta de 16 GB?
No. En nuestras mediciones, su versión de 4 bits ocupa 17 GB. Necesitas una tarjeta de 24 GB o más.
¿Qué pasa si el modelo no cabe en la GPU?
Herramientas como Ollama cargan la parte que sobra en la memoria del sistema y usan el procesador. Funciona, pero mucho más despacio, y sin mostrar ningún aviso.
¿Qué tarjeta gráfica recomendáis para IA local?
La RTX 5060 Ti de 16 GB por relación entre precio y memoria. Si también juegas a resolución alta, la RTX 5070 Ti de 16 GB, y si necesitas modelos de 27B o más, una tarjeta de 24 o 32 GB.
¿Un modelo MoE ocupa menos memoria?
No. Un modelo de mezcla de expertos ocupa lo mismo que uno denso de su tamaño total, pero va más rápido porque solo activa una parte de sus parámetros en cada paso.
¿Sirven las tarjetas AMD?
Sí, a través de ROCm, pero funcionan mejor en Linux que en Windows y tienen menos compatibilidad con algunas herramientas. NVIDIA sigue siendo la opción más sencilla.
¿Cuánta RAM necesito además de la VRAM?
Recomendamos 32 GB con una tarjeta de 16 GB y 64 GB con tarjetas de 24 o 32 GB.
Este artículo contiene enlaces afiliados a Amazon con el tag arkaiacorp-21. Si compras a través de estos enlaces, Arkaia puede recibir una comisión sin coste adicional para ti. Nuestra valoración editorial es independiente y no varía según los ingresos por afiliación.
Comentarios
Inicia sesion para dejar un comentario
Acceder