Instalar Ollama en Windows 11 lleva menos de diez minutos y no pide permisos de administrador, pero hay tres decisiones que conviene tomar antes de descargar el primer modelo: dónde vas a guardar los modelos (ocupan decenas de gigas), si tu gráfica está lista para que Ollama la use y qué modelo cabe de verdad en tu VRAM. En este tutorial lo hacemos en orden, con los comandos exactos, y al final repasamos los problemas típicos de Windows: el modelo que va lentísimo porque se ha quedado en la CPU, la gráfica AMD que no aparece y el disco C: que se llena sin avisar.
Requisitos: qué necesitas antes de empezar
Ollama es un programa gratuito y de código abierto que descarga modelos de lenguaje abiertos (Gemma, Qwen, gpt-oss, Llama, DeepSeek...) y los ejecuta en tu propio ordenador, sin enviar nada a internet. Si quieres entender primero qué es y para qué sirve, lo explicamos con calma en nuestra guía completa de Ollama. Aquí vamos directos a la instalación en Windows.
Estos son los requisitos que marca la documentación oficial de Ollama para Windows:
| Componente | Requisito | Comentario |
|---|---|---|
| Sistema operativo | Windows 10 22H2 o posterior, Home o Pro | Windows 11 funciona sin nada especial |
| Gráfica NVIDIA | Drivers 551.61 o posteriores | Cualquier driver Game Ready o Studio reciente vale |
| Gráfica AMD | Drivers con ROCm v7 / HIP 7, o drivers Radeon con Vulkan | En las RX 6000, Vulkan es la vía recomendada |
| Sin gráfica dedicada | Funciona solo con CPU | Usable con modelos pequeños, pero lento |
| Espacio en disco | Desde 4 GB por modelo pequeño | Reserva 50 GB si vas a probar varios |
| Permisos | No hace falta ser administrador | Se instala en tu cuenta de usuario |
La RAM del sistema importa menos de lo que parece si el modelo cabe entero en la gráfica. Donde sí se nota es cuando no cabe: Ollama reparte capas entre la VRAM y la RAM, y ahí 32 o 64 GB marcan la diferencia entre que un modelo arranque o no.
Paso 1: comprobar tu gráfica y su VRAM
Antes de instalar nada, averigua cuánta memoria de vídeo tienes. Es el número que decide qué modelos podrás usar con soltura. Hay dos formas rápidas.
Con el Administrador de tareas
- Pulsa
Ctrl + Shift + Esc. - Ve a la pestaña Rendimiento y selecciona GPU 0 (o GPU 1 si tienes gráfica integrada y dedicada).
- Mira la línea Memoria de GPU dedicada: ese es tu número. 8, 12, 16 o 24 GB son los valores habituales.
Ignora la «memoria de GPU compartida»: es RAM del sistema que Windows presta a la gráfica y es muchísimo más lenta para esto.
Con la terminal, si tienes NVIDIA
Abre PowerShell o Terminal y escribe:
nvidia-smi
Verás el modelo de la tarjeta, la versión del driver y, en la columna de memoria, algo como 1024MiB / 16303MiB. El segundo número es tu VRAM total. Apunta también la versión del driver: la necesitas en el paso siguiente.
Paso 2: actualizar los drivers
Es el paso que más gente se salta y el que más problemas da después. Ollama necesita drivers relativamente recientes para usar la gráfica; con unos antiguos, se instala sin quejarse y ejecuta los modelos en la CPU, diez veces más despacio, sin avisar.
- NVIDIA: abre la NVIDIA App (o GeForce Experience si aún la usas) y actualiza al último driver. Necesitas la versión 551.61 o posterior; cualquier driver de 2025 o 2026 la supera.
- AMD: instala la última versión de AMD Software: Adrenalin Edition. En las Radeon RX 7000 y 9000, Ollama puede usar ROCm; en las RX 6000, la documentación recomienda Vulkan, que viene activado por defecto.
- Intel Arc: no figura en los requisitos oficiales de Ollama para Windows. Puede que funcione a través de Vulkan, pero no está documentado: cuenta con que irá en la CPU.
Si tienes una AMD y quieres ir más allá con CUDA en Windows, tenemos un tutorial para ejecutar CUDA en gráficas AMD con ZLUDA y ROCm, aunque para Ollama no hace falta.
Paso 3: descargar e instalar Ollama
- Entra en ollama.com y pulsa Download. Elige Windows y descarga
OllamaSetup.exe. - Ejecuta el instalador. No pide permisos de administrador: se instala dentro de tu cuenta de usuario, en
%LOCALAPPDATA%\Programs\Ollama. - Al terminar, Ollama se queda funcionando en segundo plano: verás su icono en la bandeja del sistema, junto al reloj, y se abrirá la app de escritorio.
Instalar en otro disco
Si quieres que el programa vaya a otra unidad, el instalador acepta el parámetro /DIR. Abre PowerShell en la carpeta de descargas y ejecuta:
.\OllamaSetup.exe /DIR="D:\Programas\Ollama"
Ojo: esto mueve el programa, que pesa poco. Los modelos, que son lo que ocupa, van por otro lado y se configuran en el paso 4.
Comprobar que funciona
Abre una terminal nueva y escribe:
ollama --version
Si responde con un número de versión, está instalado. Si Windows dice que no reconoce el comando, cierra y vuelve a abrir la terminal: la ruta se añade al instalar y las ventanas que ya estaban abiertas no la ven.
Paso 4: mover la carpeta de modelos fuera de C:
Hazlo antes de descargar ningún modelo. Por defecto, Ollama guarda los modelos en %HOMEPATH%\.ollama, es decir, en el disco C:. Un modelo mediano ocupa entre 7 y 20 GB, y en cuanto pruebes tres o cuatro, el disco del sistema se llena.
- Cierra Ollama desde el icono de la bandeja del sistema (clic derecho, Quit Ollama).
- Abre Configuración de Windows y busca variables de entorno. Elige «Editar las variables de entorno de tu cuenta».
- En Variables de usuario, pulsa Nueva.
- Nombre:
OLLAMA_MODELS. Valor: la carpeta que quieras, por ejemploD:\IA\modelos. - Acepta y vuelve a abrir Ollama desde el menú Inicio.
Si prefieres hacerlo desde la terminal, este comando crea la misma variable para tu usuario:
setx OLLAMA_MODELS "D:\IA\modelos"
Lo ideal es que esa carpeta esté en un SSD NVMe. Los modelos se leen enteros cada vez que se cargan en memoria, y en un disco duro mecánico la primera respuesta puede tardar un minuto.
Paso 5: descargar y ejecutar tu primer modelo
Con todo preparado, el primer modelo es un solo comando. Para una gráfica de 12 GB o más, un buen punto de partida es Gemma 4 de 12B, de Google, que entiende texto e imágenes y habla un castellano excelente (con 8 GB, empieza por qwen3.5:9b, que ocupa 6,6 GB):
ollama run gemma4:12b
La primera vez descargará unos 7,6 GB. Cuando termine, verás un cursor >>>: ya puedes escribirle. Para salir, escribe /bye.
Los comandos que vas a usar a diario
| Comando | Qué hace |
|---|---|
ollama run modelo | Descarga el modelo si no lo tienes y abre un chat con él |
ollama pull modelo | Solo descarga, sin abrir el chat |
ollama list | Lista los modelos descargados y lo que ocupa cada uno |
ollama ps | Muestra los modelos cargados en memoria y si van en GPU o CPU |
ollama stop modelo | Descarga el modelo de la memoria sin cerrar Ollama |
ollama rm modelo | Borra el modelo del disco |
ollama show modelo | Muestra detalles: parámetros, contexto, capacidades |
El comando más importante: ollama ps
Con un modelo abierto, ejecuta en otra ventana de terminal:
ollama ps
Fíjate en la columna PROCESSOR. Si pone 100% GPU, perfecto: el modelo cabe entero en tu gráfica. Si pone algo como 45%/55% CPU/GPU, el modelo no cabe y parte va por la CPU, que es mucho más lenta. Es la primera cosa que hay que mirar cuando un modelo «va lento».
Qué modelo elegir según tu VRAM
La regla práctica: el tamaño de descarga del modelo tiene que caber en tu VRAM con un margen de uno o dos gigas, porque la conversación (el contexto) también ocupa memoria. Estos son los tamaños de los modelos que recomendamos este mes:
Cuánto ocupa cada modelo recomendado
Tamaño de descarga en Ollama. Para que vaya rápido, el modelo tiene que caber en la VRAM de tu gráfica con algo de margen.
Ver los datos en tabla
| Dato | Tamaño de descarga |
|---|---|
| qwen3.5:4b | 3,4 GB |
| qwen3.5:9b | 6,6 GB |
| gemma4:12b | 7,6 GB |
| gpt-oss:20b | 14,0 GB |
| qwen3.5:27b | 17,0 GB |
| gemma4:26b | 19,0 GB |
| Tu VRAM | Modelo recomendado | Comando | Para qué |
|---|---|---|---|
| Sin gráfica o 4 GB | Qwen 3.5 4B | ollama run qwen3.5:4b | Resúmenes, correos, preguntas rápidas |
| 8 GB | Qwen 3.5 9B | ollama run qwen3.5:9b | Uso general, con visión y herramientas |
| 12 GB | Gemma 4 12B | ollama run gemma4:12b | El mejor castellano de su tamaño, entiende imágenes |
| 16 GB | gpt-oss 20B | ollama run gpt-oss:20b | Razonamiento y tareas de agente |
| 24 GB | Qwen 3.5 27B o Gemma 4 26B | ollama run qwen3.5:27b | Programación y análisis largo |
Los modelos Qwen 3.5 admiten un contexto de hasta 256.000 tokens y los Gemma 4 grandes, también. Eso no significa que debas usarlo: cuanto más contexto, más VRAM. Para chatear, el que trae Ollama por defecto basta.
Si quieres el desglose completo por tarjeta, con qué cabe y qué no en cada caso, lo tienes en nuestra guía de modelos de IA local según la VRAM, y la comparativa de calidad entre familias de modelos en la de mejores modelos de IA open source.
Paso 6: la app de escritorio y la API local
La app de escritorio
Ollama incluye desde 2025 una aplicación de escritorio para Windows con una ventana de chat al estilo de ChatGPT: eliges el modelo en un desplegable, escribes y puedes arrastrar imágenes o documentos si el modelo lo admite. Para uso diario es más cómoda que la terminal, y comparte los mismos modelos, así que no hay que descargarlos dos veces.
Si necesitas algo más completo (varios usuarios, historial en el navegador, documentos para consultar), Open WebUI es la interfaz web más usada. La explicamos en la guía general de Ollama.
La API local
Ollama levanta un servidor en http://localhost:11434 con una API compatible con muchas herramientas, incluidas las que hablan el formato de OpenAI. Para probarla desde PowerShell, este es el ejemplo de la documentación oficial adaptado:
(Invoke-WebRequest -Method POST -Body '{"model":"gemma4:12b", "prompt":"Explica qué es la VRAM en una frase", "stream": false}' -Uri http://localhost:11434/api/generate).Content | ConvertFrom-Json
Con eso ya puedes conectar Ollama a editores como VS Code, a extensiones de navegador o a tus propios scripts. Si programas, en nuestro tutorial de Cursor verás cómo encaja un modelo local en un flujo de trabajo con IA.
Problemas frecuentes en Windows y cómo arreglarlos
El modelo va lentísimo
Casi siempre es porque está funcionando en la CPU. Ejecuta ollama ps: si no pone 100% GPU, hay tres causas posibles.
- El modelo no cabe en tu VRAM. Prueba uno más pequeño de la tabla anterior.
- Los drivers son antiguos. Vuelve al paso 2.
- Otra aplicación está ocupando la gráfica. Un juego abierto, un editor de vídeo o incluso el navegador con muchas pestañas de vídeo restan VRAM. Ciérralos y vuelve a cargar el modelo con
ollama stopyollama run.
Mi gráfica AMD no aparece
Revisa que tienes el último Adrenalin. En las RX 6000, Ollama usa Vulkan por defecto; en equipos con gráfica integrada y dedicada, la documentación indica usar la variable GGML_VK_VISIBLE_DEVICES para elegir la tarjeta correcta. Si aun así no la detecta, mira el registro del servidor, que se explica un poco más abajo.
El disco C: se ha llenado
Los modelos siguen en la carpeta por defecto. Haz el paso 4 y mueve la carpeta %HOMEPATH%\.ollama\models entera a la nueva ubicación antes de reiniciar Ollama, para no tener que descargar todo otra vez. Y borra lo que no uses con ollama rm.
Quiero usarlo desde otro ordenador de casa
Por defecto, Ollama solo escucha en tu propio equipo. Para abrirlo a la red local, crea la variable de entorno OLLAMA_HOST con el valor 0.0.0.0 y reinicia Ollama. Hazlo solo en una red de confianza: la API no tiene contraseña.
Dónde están los registros
Cuando algo falla, la explicación suele estar en los logs. Pega esto en el Explorador de archivos:
%LOCALAPPDATA%\Ollama
El archivo server.log dice qué gráfica ha detectado y por qué no la usa; app.log recoge los fallos de la aplicación y upgrade.log, los de las actualizaciones.
Ollama o LM Studio: cuál instalar en Windows
Es la duda más habitual de quien busca cómo instalar IA local en Windows, porque las dos opciones son gratuitas y las dos ejecutan los mismos modelos abiertos. La diferencia está en para qué las quieres.
| Aspecto | Ollama | LM Studio |
|---|---|---|
| Enfoque | Servidor ligero con terminal, API y app de chat | Aplicación gráfica completa |
| Código | Abierto | Aplicación cerrada, gratuita |
| Catálogo | Biblioteca propia con nombres cortos (gemma4:12b) | Buscador de Hugging Face con miles de variantes |
| Integración con otras herramientas | Muy amplia: editores, extensiones, agentes, scripts | Buena, con su propio servidor compatible |
| Curva de aprendizaje | Baja, pero pasa por la terminal | La más baja: todo con el ratón |
Nuestra recomendación: si vas a conectar el modelo a otras herramientas (un editor de código, un asistente con tus documentos, automatizaciones), Ollama, porque es el que más programas soportan de serie. Si solo quieres chatear con modelos y probar muchas variantes sin tocar la terminal, LM Studio es igual de válido. Y nada impide tener los dos, aunque cada uno guarda sus propios modelos y duplicarás espacio en disco.
Para ver cómo se usa Ollama con otros modelos concretos, tenemos tutoriales dedicados, como el de Llama 4 Scout y Maverick en local o la guía de Granite 4.2 con Ollama.
Cómo actualizar y desinstalar
Ollama se actualiza solo: cuando hay una versión nueva, el icono de la bandeja lo avisa y basta con reiniciar. Este mes han salido la 0.34.1 y la 0.34.2, con mejoras en el control del razonamiento de los modelos y en la gestión de memoria.
Para desinstalarlo, ve a Configuración, Aplicaciones, busca Ollama y pulsa Desinstalar. Ojo: si cambiaste la carpeta de modelos con OLLAMA_MODELS, esos archivos no se borran solos. Elimina esa carpeta a mano si quieres recuperar el espacio.
Qué hardware compensa mejorar
Si después de probar Ollama te quedas con ganas de modelos más grandes o más rápidos, estas son las mejoras por orden de impacto. No ponemos precios porque en 2026 cambian cada semana; cada enlace lleva al precio del día.
La gráfica: la mejora que más se nota
Pasar de 8 a 16 GB de VRAM es el salto que más amplía lo que puedes ejecutar. La MSI GeForce RTX 5060 Ti de 16 GB, ver precio actual en Amazon es la forma más directa de llegar ahí. Si el presupuesto es corto, la ASUS Dual RTX 3060 de 12 GB, ver disponibilidad en Amazon sigue siendo una de las gráficas de 12 GB más asequibles y de las más usadas para IA local. Y si además juegas o quieres más velocidad de generación, la MSI GeForce RTX 5070 Ti de 16 GB, ver precio actual en Amazon duplica el ancho de banda de memoria de la 5060 Ti, que es lo que marca los tokens por segundo. Las comparamos todas en la guía de mejores GPU para IA local.
RAM y disco
Con 32 GB de RAM puedes ejecutar modelos algo más grandes que tu VRAM, repartiéndolos, aunque más despacio. Con 64 GB de DDR5 Crucial Pro a 6000 MHz, ver precio actual en Amazon el margen es mucho mayor. Para los modelos, un NVMe dedicado evita el problema del disco C: lleno: el Samsung 990 EVO Plus de 2 TB, ver disponibilidad en Amazon da para una colección grande, y si vas a coleccionar modelos de 20 GB, el Lexar NM790 de 4 TB con disipador, ver precio actual en Amazon da el doble.
Para aprender más
Si quieres pasar de usar modelos a construir cosas con ellos (asistentes con tus documentos, agentes, integraciones), Ollama Local LLM Handbook, en inglés, ver disponibilidad en Amazon cubre la instalación, la personalización y el ajuste fino con Ollama. En castellano, Machine Learning con PyTorch y Scikit-Learn, ver precio actual en Amazon es la referencia para entender qué pasa por dentro.
Preguntas frecuentes
¿Ollama es gratis en Windows?
Sí. Ollama es gratuito y de código abierto, y los modelos abiertos que descarga también son gratuitos. Todo se ejecuta en tu ordenador, sin suscripción.
¿Necesito permisos de administrador para instalar Ollama?
No. El instalador OllamaSetup.exe se instala dentro de tu cuenta de usuario, en la carpeta de programas locales, sin pedir permisos de administrador.
¿Cómo cambio la carpeta donde Ollama guarda los modelos?
Crea la variable de entorno de usuario OLLAMA_MODELS con la ruta que quieras, por ejemplo D:\IA\modelos, y reinicia Ollama. Hazlo antes de descargar modelos para no llenar el disco C:.
¿Por qué Ollama va tan lento en mi PC?
Casi siempre porque el modelo se está ejecutando en la CPU. Ejecuta ollama ps: si no pone 100% GPU, el modelo no cabe en tu VRAM, los drivers son antiguos u otra aplicación está ocupando la gráfica.
¿Funciona Ollama con gráficas AMD en Windows?
Sí. Usa ROCm en las gráficas compatibles y Vulkan como alternativa, que es la opción recomendada en las Radeon RX 6000. Necesitas los drivers Adrenalin actualizados.
¿Qué modelo pongo si tengo una gráfica de 8 GB?
Qwen 3.5 9B (qwen3.5:9b), que ocupa 6,6 GB y deja margen para la conversación. Gemma 4 12B ocupa 7,6 GB y en 8 GB va muy justo: mejor a partir de 12 GB.
¿Puedo usar Ollama sin tarjeta gráfica?
Sí, en la CPU, pero es bastante más lento. Con modelos pequeños como qwen3.5:4b es usable para resúmenes y preguntas cortas.
Este artículo contiene enlaces afiliados a Amazon con el tag arkaiacorp-21. Si compras a través de estos enlaces, Arkaia puede recibir una comisión sin coste adicional para ti. Nuestra valoración editorial es independiente y no varía según los ingresos por afiliación.
Comentarios
Inicia sesion para dejar un comentario
Acceder