Llama blanca de pelo esponjoso en un prado verde de montaña al amanecer, con niebla entre las cumbres
Volver al blog
TUTORIALES 24 Septiembre 2026 16 min lectura 7 visitas

Cómo instalar Ollama en Windows 11 paso a paso: requisitos, primer modelo y solución de problemas

Chester
Chester Editor

Instalar Ollama en Windows 11 lleva menos de diez minutos y no pide permisos de administrador, pero hay tres decisiones que conviene tomar antes de descargar el primer modelo: dónde vas a guardar los modelos (ocupan decenas de gigas), si tu gráfica está lista para que Ollama la use y qué modelo cabe de verdad en tu VRAM. En este tutorial lo hacemos en orden, con los comandos exactos, y al final repasamos los problemas típicos de Windows: el modelo que va lentísimo porque se ha quedado en la CPU, la gráfica AMD que no aparece y el disco C: que se llena sin avisar.

Requisitos: qué necesitas antes de empezar

Ollama es un programa gratuito y de código abierto que descarga modelos de lenguaje abiertos (Gemma, Qwen, gpt-oss, Llama, DeepSeek...) y los ejecuta en tu propio ordenador, sin enviar nada a internet. Si quieres entender primero qué es y para qué sirve, lo explicamos con calma en nuestra guía completa de Ollama. Aquí vamos directos a la instalación en Windows.

Estos son los requisitos que marca la documentación oficial de Ollama para Windows:

ComponenteRequisitoComentario
Sistema operativoWindows 10 22H2 o posterior, Home o ProWindows 11 funciona sin nada especial
Gráfica NVIDIADrivers 551.61 o posterioresCualquier driver Game Ready o Studio reciente vale
Gráfica AMDDrivers con ROCm v7 / HIP 7, o drivers Radeon con VulkanEn las RX 6000, Vulkan es la vía recomendada
Sin gráfica dedicadaFunciona solo con CPUUsable con modelos pequeños, pero lento
Espacio en discoDesde 4 GB por modelo pequeñoReserva 50 GB si vas a probar varios
PermisosNo hace falta ser administradorSe instala en tu cuenta de usuario

La RAM del sistema importa menos de lo que parece si el modelo cabe entero en la gráfica. Donde sí se nota es cuando no cabe: Ollama reparte capas entre la VRAM y la RAM, y ahí 32 o 64 GB marcan la diferencia entre que un modelo arranque o no.

Paso 1: comprobar tu gráfica y su VRAM

Antes de instalar nada, averigua cuánta memoria de vídeo tienes. Es el número que decide qué modelos podrás usar con soltura. Hay dos formas rápidas.

Con el Administrador de tareas

  1. Pulsa Ctrl + Shift + Esc.
  2. Ve a la pestaña Rendimiento y selecciona GPU 0 (o GPU 1 si tienes gráfica integrada y dedicada).
  3. Mira la línea Memoria de GPU dedicada: ese es tu número. 8, 12, 16 o 24 GB son los valores habituales.

Ignora la «memoria de GPU compartida»: es RAM del sistema que Windows presta a la gráfica y es muchísimo más lenta para esto.

Con la terminal, si tienes NVIDIA

Abre PowerShell o Terminal y escribe:

nvidia-smi

Verás el modelo de la tarjeta, la versión del driver y, en la columna de memoria, algo como 1024MiB / 16303MiB. El segundo número es tu VRAM total. Apunta también la versión del driver: la necesitas en el paso siguiente.

Manos sujetando una tarjeta gráfica de dos ventiladores sobre un PC de sobremesa abierto con luz azulada
La VRAM de la gráfica es el dato que decide qué modelos podrás ejecutar con fluidez.

Paso 2: actualizar los drivers

Es el paso que más gente se salta y el que más problemas da después. Ollama necesita drivers relativamente recientes para usar la gráfica; con unos antiguos, se instala sin quejarse y ejecuta los modelos en la CPU, diez veces más despacio, sin avisar.

  • NVIDIA: abre la NVIDIA App (o GeForce Experience si aún la usas) y actualiza al último driver. Necesitas la versión 551.61 o posterior; cualquier driver de 2025 o 2026 la supera.
  • AMD: instala la última versión de AMD Software: Adrenalin Edition. En las Radeon RX 7000 y 9000, Ollama puede usar ROCm; en las RX 6000, la documentación recomienda Vulkan, que viene activado por defecto.
  • Intel Arc: no figura en los requisitos oficiales de Ollama para Windows. Puede que funcione a través de Vulkan, pero no está documentado: cuenta con que irá en la CPU.

Si tienes una AMD y quieres ir más allá con CUDA en Windows, tenemos un tutorial para ejecutar CUDA en gráficas AMD con ZLUDA y ROCm, aunque para Ollama no hace falta.

Paso 3: descargar e instalar Ollama

  1. Entra en ollama.com y pulsa Download. Elige Windows y descarga OllamaSetup.exe.
  2. Ejecuta el instalador. No pide permisos de administrador: se instala dentro de tu cuenta de usuario, en %LOCALAPPDATA%\Programs\Ollama.
  3. Al terminar, Ollama se queda funcionando en segundo plano: verás su icono en la bandeja del sistema, junto al reloj, y se abrirá la app de escritorio.

Instalar en otro disco

Si quieres que el programa vaya a otra unidad, el instalador acepta el parámetro /DIR. Abre PowerShell en la carpeta de descargas y ejecuta:

.\OllamaSetup.exe /DIR="D:\Programas\Ollama"

Ojo: esto mueve el programa, que pesa poco. Los modelos, que son lo que ocupa, van por otro lado y se configuran en el paso 4.

Comprobar que funciona

Abre una terminal nueva y escribe:

ollama --version

Si responde con un número de versión, está instalado. Si Windows dice que no reconoce el comando, cierra y vuelve a abrir la terminal: la ruta se añade al instalar y las ventanas que ya estaban abiertas no la ven.

Paso 4: mover la carpeta de modelos fuera de C:

Hazlo antes de descargar ningún modelo. Por defecto, Ollama guarda los modelos en %HOMEPATH%\.ollama, es decir, en el disco C:. Un modelo mediano ocupa entre 7 y 20 GB, y en cuanto pruebes tres o cuatro, el disco del sistema se llena.

  1. Cierra Ollama desde el icono de la bandeja del sistema (clic derecho, Quit Ollama).
  2. Abre Configuración de Windows y busca variables de entorno. Elige «Editar las variables de entorno de tu cuenta».
  3. En Variables de usuario, pulsa Nueva.
  4. Nombre: OLLAMA_MODELS. Valor: la carpeta que quieras, por ejemplo D:\IA\modelos.
  5. Acepta y vuelve a abrir Ollama desde el menú Inicio.

Si prefieres hacerlo desde la terminal, este comando crea la misma variable para tu usuario:

setx OLLAMA_MODELS "D:\IA\modelos"

Lo ideal es que esa carpeta esté en un SSD NVMe. Los modelos se leen enteros cada vez que se cargan en memoria, y en un disco duro mecánico la primera respuesta puede tardar un minuto.

Paso 5: descargar y ejecutar tu primer modelo

Con todo preparado, el primer modelo es un solo comando. Para una gráfica de 12 GB o más, un buen punto de partida es Gemma 4 de 12B, de Google, que entiende texto e imágenes y habla un castellano excelente (con 8 GB, empieza por qwen3.5:9b, que ocupa 6,6 GB):

ollama run gemma4:12b

La primera vez descargará unos 7,6 GB. Cuando termine, verás un cursor >>>: ya puedes escribirle. Para salir, escribe /bye.

Los comandos que vas a usar a diario

ComandoQué hace
ollama run modeloDescarga el modelo si no lo tienes y abre un chat con él
ollama pull modeloSolo descarga, sin abrir el chat
ollama listLista los modelos descargados y lo que ocupa cada uno
ollama psMuestra los modelos cargados en memoria y si van en GPU o CPU
ollama stop modeloDescarga el modelo de la memoria sin cerrar Ollama
ollama rm modeloBorra el modelo del disco
ollama show modeloMuestra detalles: parámetros, contexto, capacidades

El comando más importante: ollama ps

Con un modelo abierto, ejecuta en otra ventana de terminal:

ollama ps

Fíjate en la columna PROCESSOR. Si pone 100% GPU, perfecto: el modelo cabe entero en tu gráfica. Si pone algo como 45%/55% CPU/GPU, el modelo no cabe y parte va por la CPU, que es mucho más lenta. Es la primera cosa que hay que mirar cuando un modelo «va lento».

Portátil abierto sobre un escritorio de noche con la pantalla desenfocada y luz de flexo cálida
Todo Ollama se maneja con media docena de comandos en la terminal de Windows.

Qué modelo elegir según tu VRAM

La regla práctica: el tamaño de descarga del modelo tiene que caber en tu VRAM con un margen de uno o dos gigas, porque la conversación (el contexto) también ocupa memoria. Estos son los tamaños de los modelos que recomendamos este mes:

Cuánto ocupa cada modelo recomendado

Tamaño de descarga en Ollama. Para que vaya rápido, el modelo tiene que caber en la VRAM de tu gráfica con algo de margen.

Cuánto ocupa cada modelo recomendadoTamaño de descarga en Ollama. Para que vaya rápido, el modelo tiene que caber en la VRAM de tu gráfica con algo de margen.qwen3.5:4bTamaño de descarga: 3,4 GB — qwen3.5:4b3,4 GBqwen3.5:9bTamaño de descarga: 6,6 GB — qwen3.5:9b6,6 GBgemma4:12bTamaño de descarga: 7,6 GB — gemma4:12b7,6 GBgpt-oss:20bTamaño de descarga: 14,0 GB — gpt-oss:20b14,0 GBqwen3.5:27bTamaño de descarga: 17,0 GB — qwen3.5:27b17,0 GBgemma4:26bTamaño de descarga: 19,0 GB — gemma4:26b19,0 GB0 GB5 GB10 GB15 GB20 GB
Ver los datos en tabla
DatoTamaño de descarga
qwen3.5:4b3,4 GB
qwen3.5:9b6,6 GB
gemma4:12b7,6 GB
gpt-oss:20b14,0 GB
qwen3.5:27b17,0 GB
gemma4:26b19,0 GB
Tamaños de la biblioteca de Ollama, septiembre de 2026 (cuantización por defecto).
Tu VRAMModelo recomendadoComandoPara qué
Sin gráfica o 4 GBQwen 3.5 4Bollama run qwen3.5:4bResúmenes, correos, preguntas rápidas
8 GBQwen 3.5 9Bollama run qwen3.5:9bUso general, con visión y herramientas
12 GBGemma 4 12Bollama run gemma4:12bEl mejor castellano de su tamaño, entiende imágenes
16 GBgpt-oss 20Bollama run gpt-oss:20bRazonamiento y tareas de agente
24 GBQwen 3.5 27B o Gemma 4 26Bollama run qwen3.5:27bProgramación y análisis largo

Los modelos Qwen 3.5 admiten un contexto de hasta 256.000 tokens y los Gemma 4 grandes, también. Eso no significa que debas usarlo: cuanto más contexto, más VRAM. Para chatear, el que trae Ollama por defecto basta.

Si quieres el desglose completo por tarjeta, con qué cabe y qué no en cada caso, lo tienes en nuestra guía de modelos de IA local según la VRAM, y la comparativa de calidad entre familias de modelos en la de mejores modelos de IA open source.

Paso 6: la app de escritorio y la API local

La app de escritorio

Ollama incluye desde 2025 una aplicación de escritorio para Windows con una ventana de chat al estilo de ChatGPT: eliges el modelo en un desplegable, escribes y puedes arrastrar imágenes o documentos si el modelo lo admite. Para uso diario es más cómoda que la terminal, y comparte los mismos modelos, así que no hay que descargarlos dos veces.

Si necesitas algo más completo (varios usuarios, historial en el navegador, documentos para consultar), Open WebUI es la interfaz web más usada. La explicamos en la guía general de Ollama.

La API local

Ollama levanta un servidor en http://localhost:11434 con una API compatible con muchas herramientas, incluidas las que hablan el formato de OpenAI. Para probarla desde PowerShell, este es el ejemplo de la documentación oficial adaptado:

(Invoke-WebRequest -Method POST -Body '{"model":"gemma4:12b", "prompt":"Explica qué es la VRAM en una frase", "stream": false}' -Uri http://localhost:11434/api/generate).Content | ConvertFrom-Json

Con eso ya puedes conectar Ollama a editores como VS Code, a extensiones de navegador o a tus propios scripts. Si programas, en nuestro tutorial de Cursor verás cómo encaja un modelo local en un flujo de trabajo con IA.

Problemas frecuentes en Windows y cómo arreglarlos

El modelo va lentísimo

Casi siempre es porque está funcionando en la CPU. Ejecuta ollama ps: si no pone 100% GPU, hay tres causas posibles.

  • El modelo no cabe en tu VRAM. Prueba uno más pequeño de la tabla anterior.
  • Los drivers son antiguos. Vuelve al paso 2.
  • Otra aplicación está ocupando la gráfica. Un juego abierto, un editor de vídeo o incluso el navegador con muchas pestañas de vídeo restan VRAM. Ciérralos y vuelve a cargar el modelo con ollama stop y ollama run.

Mi gráfica AMD no aparece

Revisa que tienes el último Adrenalin. En las RX 6000, Ollama usa Vulkan por defecto; en equipos con gráfica integrada y dedicada, la documentación indica usar la variable GGML_VK_VISIBLE_DEVICES para elegir la tarjeta correcta. Si aun así no la detecta, mira el registro del servidor, que se explica un poco más abajo.

El disco C: se ha llenado

Los modelos siguen en la carpeta por defecto. Haz el paso 4 y mueve la carpeta %HOMEPATH%\.ollama\models entera a la nueva ubicación antes de reiniciar Ollama, para no tener que descargar todo otra vez. Y borra lo que no uses con ollama rm.

Quiero usarlo desde otro ordenador de casa

Por defecto, Ollama solo escucha en tu propio equipo. Para abrirlo a la red local, crea la variable de entorno OLLAMA_HOST con el valor 0.0.0.0 y reinicia Ollama. Hazlo solo en una red de confianza: la API no tiene contraseña.

Dónde están los registros

Cuando algo falla, la explicación suele estar en los logs. Pega esto en el Explorador de archivos:

%LOCALAPPDATA%\Ollama

El archivo server.log dice qué gráfica ha detectado y por qué no la usa; app.log recoge los fallos de la aplicación y upgrade.log, los de las actualizaciones.

Ollama o LM Studio: cuál instalar en Windows

Es la duda más habitual de quien busca cómo instalar IA local en Windows, porque las dos opciones son gratuitas y las dos ejecutan los mismos modelos abiertos. La diferencia está en para qué las quieres.

AspectoOllamaLM Studio
EnfoqueServidor ligero con terminal, API y app de chatAplicación gráfica completa
CódigoAbiertoAplicación cerrada, gratuita
CatálogoBiblioteca propia con nombres cortos (gemma4:12b)Buscador de Hugging Face con miles de variantes
Integración con otras herramientasMuy amplia: editores, extensiones, agentes, scriptsBuena, con su propio servidor compatible
Curva de aprendizajeBaja, pero pasa por la terminalLa más baja: todo con el ratón

Nuestra recomendación: si vas a conectar el modelo a otras herramientas (un editor de código, un asistente con tus documentos, automatizaciones), Ollama, porque es el que más programas soportan de serie. Si solo quieres chatear con modelos y probar muchas variantes sin tocar la terminal, LM Studio es igual de válido. Y nada impide tener los dos, aunque cada uno guarda sus propios modelos y duplicarás espacio en disco.

Para ver cómo se usa Ollama con otros modelos concretos, tenemos tutoriales dedicados, como el de Llama 4 Scout y Maverick en local o la guía de Granite 4.2 con Ollama.

Cómo actualizar y desinstalar

Ollama se actualiza solo: cuando hay una versión nueva, el icono de la bandeja lo avisa y basta con reiniciar. Este mes han salido la 0.34.1 y la 0.34.2, con mejoras en el control del razonamiento de los modelos y en la gestión de memoria.

Para desinstalarlo, ve a Configuración, Aplicaciones, busca Ollama y pulsa Desinstalar. Ojo: si cambiaste la carpeta de modelos con OLLAMA_MODELS, esos archivos no se borran solos. Elimina esa carpeta a mano si quieres recuperar el espacio.

Unidad SSD NVMe M.2 junto a su tornillo sobre una alfombrilla antiestática
Un SSD NVMe dedicado a los modelos evita llenar el disco del sistema y acorta los tiempos de carga.

Qué hardware compensa mejorar

Si después de probar Ollama te quedas con ganas de modelos más grandes o más rápidos, estas son las mejoras por orden de impacto. No ponemos precios porque en 2026 cambian cada semana; cada enlace lleva al precio del día.

La gráfica: la mejora que más se nota

Pasar de 8 a 16 GB de VRAM es el salto que más amplía lo que puedes ejecutar. La MSI GeForce RTX 5060 Ti de 16 GB, ver precio actual en Amazon es la forma más directa de llegar ahí. Si el presupuesto es corto, la ASUS Dual RTX 3060 de 12 GB, ver disponibilidad en Amazon sigue siendo una de las gráficas de 12 GB más asequibles y de las más usadas para IA local. Y si además juegas o quieres más velocidad de generación, la MSI GeForce RTX 5070 Ti de 16 GB, ver precio actual en Amazon duplica el ancho de banda de memoria de la 5060 Ti, que es lo que marca los tokens por segundo. Las comparamos todas en la guía de mejores GPU para IA local.

RAM y disco

Con 32 GB de RAM puedes ejecutar modelos algo más grandes que tu VRAM, repartiéndolos, aunque más despacio. Con 64 GB de DDR5 Crucial Pro a 6000 MHz, ver precio actual en Amazon el margen es mucho mayor. Para los modelos, un NVMe dedicado evita el problema del disco C: lleno: el Samsung 990 EVO Plus de 2 TB, ver disponibilidad en Amazon da para una colección grande, y si vas a coleccionar modelos de 20 GB, el Lexar NM790 de 4 TB con disipador, ver precio actual en Amazon da el doble.

Para aprender más

Si quieres pasar de usar modelos a construir cosas con ellos (asistentes con tus documentos, agentes, integraciones), Ollama Local LLM Handbook, en inglés, ver disponibilidad en Amazon cubre la instalación, la personalización y el ajuste fino con Ollama. En castellano, Machine Learning con PyTorch y Scikit-Learn, ver precio actual en Amazon es la referencia para entender qué pasa por dentro.

Preguntas frecuentes

¿Ollama es gratis en Windows?

Sí. Ollama es gratuito y de código abierto, y los modelos abiertos que descarga también son gratuitos. Todo se ejecuta en tu ordenador, sin suscripción.

¿Necesito permisos de administrador para instalar Ollama?

No. El instalador OllamaSetup.exe se instala dentro de tu cuenta de usuario, en la carpeta de programas locales, sin pedir permisos de administrador.

¿Cómo cambio la carpeta donde Ollama guarda los modelos?

Crea la variable de entorno de usuario OLLAMA_MODELS con la ruta que quieras, por ejemplo D:\IA\modelos, y reinicia Ollama. Hazlo antes de descargar modelos para no llenar el disco C:.

¿Por qué Ollama va tan lento en mi PC?

Casi siempre porque el modelo se está ejecutando en la CPU. Ejecuta ollama ps: si no pone 100% GPU, el modelo no cabe en tu VRAM, los drivers son antiguos u otra aplicación está ocupando la gráfica.

¿Funciona Ollama con gráficas AMD en Windows?

Sí. Usa ROCm en las gráficas compatibles y Vulkan como alternativa, que es la opción recomendada en las Radeon RX 6000. Necesitas los drivers Adrenalin actualizados.

¿Qué modelo pongo si tengo una gráfica de 8 GB?

Qwen 3.5 9B (qwen3.5:9b), que ocupa 6,6 GB y deja margen para la conversación. Gemma 4 12B ocupa 7,6 GB y en 8 GB va muy justo: mejor a partir de 12 GB.

¿Puedo usar Ollama sin tarjeta gráfica?

Sí, en la CPU, pero es bastante más lento. Con modelos pequeños como qwen3.5:4b es usable para resúmenes y preguntas cortas.

Este artículo contiene enlaces afiliados a Amazon con el tag arkaiacorp-21. Si compras a través de estos enlaces, Arkaia puede recibir una comisión sin coste adicional para ti. Nuestra valoración editorial es independiente y no varía según los ingresos por afiliación.

Compartir:

Comentarios

Cargando comentarios...