- Código abierto bajo licencia MIT: gratuito para uso personal y comercial, sin límites de uso.
- Un solo comando para descargar y ejecutar modelos:
ollama run llama3.2y listo. - API REST compatible con OpenAI: cualquier SDK o herramienta que soporte OpenAI funciona con Ollama sin cambios de código.
- Aceleración GPU en NVIDIA, AMD y Apple Silicon (Metal): rendimiento nativo en el hardware que ya tienes.
- Más de 200 modelos en la biblioteca oficial, incluyendo DeepSeek-R1, Llama 3.3, Gemma 3 y Qwen 2.5.
¿Qué es Ollama y por qué ejecutar modelos de IA en local?
Ollama es un gestor de modelos de lenguaje para ejecutar LLMs en tu propio hardware. Funciona de forma parecida a Docker para contenedores o Homebrew para paquetes: abstrae toda la complejidad de descarga, conversión de formato, gestión de capas de cuantización y configuración de drivers de GPU en un único binario y un conjunto de comandos simples. El proyecto nació en 2023, se publicó como open source en GitHub y ha crecido hasta convertirse en la referencia del ecosistema local con cerca de 171 000 estrellas (mayo 2026).
La razón principal para ejecutar modelos en local es la privacidad de los datos: ninguna conversación, documento ni prompt sale de tu máquina. Para empresas que trabajan con datos sensibles — jurídicos, médicos, financieros — esto elimina una categoría entera de riesgos de cumplimiento. La segunda razón es el coste a largo plazo: un servidor con GPU tiene un coste fijo, mientras que las APIs de cloud escalan con el uso. A partir de cierto volumen, la infraestructura propia es más económica. La tercera es el control: decides qué versión del modelo usas, cuándo actualizas y cómo configuras el contexto o los parámetros de generación, sin depender de los cambios de política o deprecación de un proveedor externo.
Ollama no es la única opción para ejecutar modelos en local — existen LM Studio, llama.cpp y vLLM — pero su combinación de CLI minimalista, API REST nativa y soporte amplio de hardware lo convierte en el punto de partida más práctico para la mayoría de proyectos. Si quieres comparar opciones, tenemos una comparativa detallada de Ollama frente a LLM Studio.
Privacidad total
Todos los datos y conversaciones permanecen en tu hardware. No se envía ninguna información a servidores externos. Ideal para proyectos con datos sensibles o regulados.
Coste cero de inferencia
Una vez instalado, ejecutar miles de peticiones al día no tiene coste adicional. Sin tokens, sin suscripciones, sin limites de rate. Solo el coste de la electricidad y el hardware.
Latencia baja en local
Sin latencia de red. En hardware moderno con GPU, los modelos de 7B parámetros responden en milisegundos. Perfecto para integraciones en tiempo real o experimentos rápidos.
Control de versiones de modelos
Congelas el modelo que funciona en tu proyecto y no dependes de actualizaciones del proveedor. Reproducibilidad garantizada en experimentos y producción.
¿Cómo instalar Ollama en tu sistema?
La instalación de Ollama es deliberadamente simple. En menos de cinco minutos puedes tener tu primer modelo corriendo. A continuación los pasos para cada sistema operativo.
.dmg desde
ollama.com/download
o instala via Homebrew:
brew install ollama
Ollama se instala como una aplicación de barra de menú. Soporta Apple Silicon (M1/M2/M3/M4)
de forma nativa con aceleración Metal. En macOS Intel funciona pero sin aceleración GPU.
curl -fsSL https://ollama.com/install.sh | sh
El servicio arranca automáticamente. Para GPUs NVIDIA asegúrate de tener instalados
los drivers CUDA 12+. Para GPUs AMD, ROCm 5.7 o superior.
Distribuciones soportadas: Ubuntu, Debian, Fedora, Arch y derivados.
.exe desde
ollama.com.
Ollama corre como proceso en segundo plano y es accesible desde PowerShell o CMD.
Soporta GPU NVIDIA con drivers actualizados. La aceleración AMD en Windows está disponible
pero en fase experimental. WSL2 también funciona si prefieres entorno Linux.
Primer modelo en tres comandos
Una vez instalado Ollama, ejecutar tu primer modelo es inmediato. Si ollama run
no encuentra el modelo localmente, lo descarga automáticamente de la biblioteca oficial.
# Ejecutar Llama 3.2 (3B parámetros, ~2 GB)
ollama run llama3.2
# Listar modelos descargados
ollama list
# Descargar un modelo sin ejecutarlo
ollama pull deepseek-r1:7b
# Ver informacion de un modelo
ollama show llama3.2
La primera vez que ejecutas un modelo, Ollama lo descarga en ~/.ollama/models/.
Los modelos se almacenan en formato GGUF y se cargan directamente en VRAM si hay GPU disponible,
o en RAM si no. Puedes consultar la biblioteca completa en
ollama.com/library.
¿Qué modelos puedes ejecutar con Ollama?
Ollama soporta todos los modelos en formato GGUF. La biblioteca oficial cuenta con más de 200 modelos preconfigurados. Aquí los más relevantes con sus requisitos de hardware y casos de uso ideales.
| Modelo | Tamaño | VRAM mínima | Caso de uso ideal | Comando |
|---|---|---|---|---|
| Llama 3.2 | 3B / 11B | 4 GB / 8 GB | Asistente general, tareas rápidas, producción ligera | ollama run llama3.2 |
| Llama 3.3 | 70B | 48 GB | Razonamiento avanzado, código complejo, análisis profundo | ollama run llama3.3 |
| DeepSeek-R1 | 7B / 14B / 70B | 8 GB / 16 GB / 48 GB | Razonamiento matemático, código, tareas STEM | ollama run deepseek-r1:7b |
| Mistral | 7B | 8 GB | Equilibrio rendimiento-tamaño, instrucciones generales | ollama run mistral |
| Gemma 3 | 4B / 12B / 27B | 6 GB / 12 GB / 20 GB | Tareas multimodales, visión, asistente ligero | ollama run gemma3 |
| Phi-4 | 14B | 10 GB | Razonamiento con modelo compacto, ideal para hardware limitado | ollama run phi4 |
| Qwen 2.5 | 7B / 14B / 72B | 8 GB / 12 GB / 48 GB | Código, asistente multilingue, proyectos con requisitos chino/ingles | ollama run qwen2.5 |
| CodeLlama | 7B / 13B / 34B | 8 GB / 16 GB / 24 GB | Generación de código, completado, explicación de código | ollama run codellama |
Para ver todos los modelos disponibles y sus variantes de cuantización visita
ollama.com/library.
Puedes explorar los modelos por categoría: código, razonamiento, visión, embedding o multimodal.
La nomenclatura de etiquetas sigue el patrón modelo:tamaño-cuantización,
por ejemplo deepseek-r1:14b-instruct-q4_K_M. Si no específicas etiqueta,
Ollama descarga la variante recomendada para uso general.
Además de los modelos de la biblioteca oficial, puedes importar cualquier modelo en formato
GGUF descargado desde Hugging Face u otras fuentes mediante ollama create y
un archivo Modelfile. Esto te permite usar modelos ajustados (fine-tuned) o modelos
propietarios que hayas entrenado internamente. Consulta la documentación oficial en
github.com/ollama/ollama
para el formato exacto del Modelfile.
¿Cómo funciona la API de Ollama?
Ollama expone dos APIs: su API nativa en /api/ y una API compatible con OpenAI en
/v1/. La compatibilidad con OpenAI es el mayor activo de Ollama para integraciones:
cualquier herramienta o SDK que soporte OpenAI funciona sin cambios de código.
API compatible con OpenAI
Ollama expone el endpoint http://localhost:11434/v1/ que implementa el mismo
esquema de la API de OpenAI. Esto significa que puedes usar el SDK oficial de OpenAI,
LangChain, LlamaIndex u otras bibliotecas simplemente cambiando la URL base y el modelo.
# Con Python y el SDK de OpenAI
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1/",
api_key="ollama", # puede ser cualquier cadena
)
response = client.chat.completions.create(
model="llama3.2",
messages=[
{"role": "system", "content": "Eres un asistente util."},
{"role": "user", "content": "Explica que es un agente de IA en dos parrafos."},
],
)
print(response.choices[0].message.content)
API nativa de Ollama
La API nativa de Ollama en http://localhost:11434/api/ ofrece funcionalidades
adicionales como streaming nativo, gestión de modelos y acceso a metadatos del modelo.
Es la recomendada si construyes integraciones específicas para Ollama.
# Chat con la API nativa (curl)
curl http://localhost:11434/api/chat -d '{
"model": "llama3.2",
"messages": [
{"role": "user", "content": "Que diferencia hay entre LLM y un agente de IA?"}
],
"stream": false
}'
# Listar modelos instalados via API
curl http://localhost:11434/api/tags
# Verificar que Ollama esta corriendo
curl http://localhost:11434/api/version
Embeddings con Ollama
Ollama también soporta generación de embeddings, necesarios para implementar búsqueda
semántica y RAG (Retrieval Augmented Generation). Los modelos de embedding más usados
son nomic-embed-text y mxbai-embed-large.
# Generar embeddings
curl http://localhost:11434/api/embed -d '{
"model": "nomic-embed-text",
"input": "El agente de IA proceso la solicitud del usuario."
}'
¿Cómo usar Ollama con Docker?
Ollama tiene imagen oficial de Docker disponible en Docker Hub. El uso con contenedores es la forma recomendada para desplegar Ollama en servidores o en entornos de CI/CD donde necesitas reproducibilidad y aislamiento.
Iniciar Ollama con Docker
# Solo CPU
docker run -d \
-v ollama:/root/.ollama \
-p 11434:11434 \
--name ollama \
ollama/ollama
# Con GPU NVIDIA (requiere nvidia-container-toolkit)
docker run -d \
--gpus=all \
-v ollama:/root/.ollama \
-p 11434:11434 \
--name ollama \
ollama/ollama
# Ejecutar un modelo dentro del contenedor
docker exec -it ollama ollama run llama3.2
Docker Compose con interfaz web
La forma más completa de desplegar Ollama es combinarlo con Open WebUI, una interfaz gráfica web compatible que permite usar Ollama desde el navegador de forma similar a ChatGPT, con soporte para múltiples usuarios y gestión de conversaciones.
# docker-compose.yml
services:
ollama:
image: ollama/ollama
volumes:
- ollama:/root/.ollama
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: all
capabilities: [gpu]
open-webui:
image: ghcr.io/open-webui/open-webui:main
ports:
- "3000:8080"
environment:
- OLLAMA_BASE_URL=http://ollama:11434
depends_on:
- ollama
volumes:
ollama:
Con esta configuración accedes a la interfaz web en http://localhost:3000.
Open WebUI también soporta la API de OpenAI, por lo que puedes conectar tanto Ollama
como proveedores cloud desde la misma interfaz. Para entornos sin GPU, elimina el bloque
deploy.resources del docker-compose.
¿Qué GPU necesitas y cómo funciona la cuantización?
El rendimiento de Ollama depende directamente del hardware disponible. Entender los requisitos de VRAM y los niveles de cuantización te ayudará a elegir el modelo adecuado para tu máquina.
| Tamaño del modelo | Q4_K_M (recomendado) | Q8_0 (alta calidad) | F16 (sin cuantizar) | Velocidad estimada (tok/s en RTX 4080) |
|---|---|---|---|---|
| 3B parámetros | 2,5 GB | 4 GB | 6 GB | ~120 tok/s |
| 7B parámetros | 5 GB | 8 GB | 14 GB | ~60 tok/s |
| 13B parámetros | 9 GB | 14 GB | 26 GB | ~30 tok/s |
| 34B parámetros | 22 GB | 36 GB | 68 GB | ~15 tok/s |
| 70B parámetros | 45 GB | 70 GB | 140 GB | ~7 tok/s |
¿Qué nivel de cuantización elegir?
La cuantización reduce la precisión numérica de los pesos del modelo para que ocupen menos memoria. Ollama usa el formato GGUF con varios niveles:
- Q4_K_M: el equilibrio más recomendado. Reduce el tamaño a aproximadamente un 35% del original con una pérdida de calidad apenas perceptible. Es la variante por defecto en la mayoría de modelos de la biblioteca de Ollama.
- Q5_K_M: un poco más grande que Q4_K_M pero con mejor calidad. Buena opción si tienes VRAM de sobra y quieres maximizar precisión.
- Q8_0: prácticamente equivalente al modelo en precisión completa. Ocupa el doble que Q4_K_M. Recomendado cuando la calidad es crítica y el hardware lo permite.
- F16: el modelo sin cuantizar. Solo tiene sentido en hardware con gran cantidad de VRAM o para fines de investigación.
Si tu GPU no tiene suficiente VRAM para cargar el modelo completo, Ollama distribuye
automáticamente las capas entre VRAM y RAM del sistema (offloading). El rendimiento
baja significativamente cuando hay offloading, pero el modelo sigue siendo funcional.
Puedes ver cuántas capas se cargan en GPU con ollama ps.
Hardware compatible con Ollama
- NVIDIA: cualquier GPU con CUDA 12+ y al menos 4 GB de VRAM. Las series RTX 3000, 4000 y 5000 son las más comunes en entornos de desarrollo.
- AMD: GPUs con ROCm 5.7+ en Linux. Soporte experimental en Windows.
- Apple Silicon: M1, M2, M3 y M4 con aceleración Metal nativa. La memoria unificada (hasta 128 GB en Mac Pro) permite ejecutar modelos muy grandes.
- Solo CPU: funciona pero es significativamente más lento. Recomendable solo para modelos de 3B o menores, o para desarrollo y pruebas.
¿Por qué Ollama + DeepSeek es la combinación más popular?
La llegada de DeepSeek-R1 a principios de 2025 fue un punto de inflexión para la IA en local. Por primera vez había un modelo de razonamiento de primer nivel que podía ejecutarse en hardware de consumo. Ollama fue la herramienta que lo hizo accesible al público general.
DeepSeek-R1 es un modelo de razonamiento desarrollado por la empresa china DeepSeek que compite con los mejores modelos de OpenAI en tareas de matemáticas, código y lógica, pero con un tamaño mucho más eficiente en relación con su rendimiento. Las variantes más pequeñas (7B y 14B parámetros) son ejecutables en hardware de consumo con GPU de gama media-alta.
La popularidad de la combinación Ollama + DeepSeek se debe a varios factores:
- Razonamiento en cadena visible: DeepSeek-R1 muestra su proceso de
pensamiento en bloques
<think>, lo que lo hace ideal para tareas que requieren transparencia en el razonamiento. - Rendimiento en código: supera a la mayoría de modelos de su tamaño en benchmarks de generación y explicación de código. Es una alternativa local sólida a GPT-4 para asistentes de programación.
- Bajo coste de hardware: la variante de 7B funciona correctamente en GPUs con 8 GB de VRAM, accesibles desde 300-400 euros en el mercado de segunda mano.
# Descargar y ejecutar DeepSeek-R1 de 7B (recomendado para empezar)
ollama pull deepseek-r1:7b
# O la variante de 14B para mayor calidad (requiere 16 GB VRAM)
ollama pull deepseek-r1:14b
# Ejecutar con contexto extendido
ollama run deepseek-r1:7b --verbose
# Via API (compatible OpenAI)
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-r1:7b",
"messages": [{"role": "user", "content": "Implementa un algoritmo de busqueda binaria en Python con tests."}]
}'
Para profundizar en DeepSeek y sus variantes, tenemos una guía específica en Ollama con DeepSeek: guía completa. Puedes además comparar modelos de razonamiento local frente a los modelos cloud en nuestra sección de comparativas.
Ollama frente a otras herramientas para IA en local
Ollama no es la única opción. Dependiendo de tu caso de uso, otras herramientas pueden ser más adecuadas. Esta tabla resume las diferencias clave.
| Herramienta | Tipo | Interfaz | API compatible OpenAI | Mejor para |
|---|---|---|---|---|
| Ollama | CLI + servidor | Terminal / API REST | Si | Desarrollo, prototipado, integraciones programáticas |
| LM Studio | Aplicación de escritorio | GUI completa | Si | Usuarios sin experiencia en terminal, comparar modelos visualmente |
| llama.cpp | Libreria / CLI de bajo nivel | Terminal | Si (servidor adicional) | Control máximo, integración en código C/C++, rendimiento óptimo |
| vLLM | Servidor de inferencia | API REST | Si | Producción a escala, múltiples usuarios concurrentes, alto throughput |
Elige Ollama si eres desarrollador, trabajas principalmente desde terminal y necesitas integraciones programáticas rápidas. Es también la mejor opción para configurar modelos locales como backend de herramientas como Claude Code u otros agentes de coding. Para una comparativa detallada entre Ollama y LM Studio, visita Ollama vs LLM Studio.
Elige LM Studio si prefieres una interfaz gráfica, quieres explorar modelos visualmente sin tocar el terminal o no tienes experiencia con herramientas CLI. Elige llama.cpp si necesitas el máximo control y rendimiento posible, o si integras la inferencia directamente en tu código C/C++. Elige vLLM si tienes un caso de producción con múltiples usuarios concurrentes y necesitas maximizar el throughput: vLLM implementa PagedAttention y otras optimizaciones que lo hacen significativamente más eficiente que Ollama para cargas altas.
Para el desarrollo de modelos LLM en general y la arquitectura de agentes que los consumen, consulta nuestra guía de frameworks para agentes de IA donde comparamos tanto opciones cloud como locales en el contexto completo de un agente en producción.
Preguntas frecuentes sobre Ollama
¿Es Ollama completamente gratuito?
Sí. Ollama es software de código abierto publicado bajo licencia MIT. Puedes instalarlo, usarlo en proyectos personales y comerciales, modificarlo y redistribuirlo sin coste alguno. No hay planes de pago, límites de uso ni funcionalidades de pago. El único coste es el hardware necesario para ejecutar los modelos.
¿Necesito GPU para usar Ollama?
No es obligatorio. Ollama puede ejecutarse solo con CPU, aunque el rendimiento es mucho menor: un modelo de 7B puede tardar varios segundos por token sin GPU frente a decenas de tokens por segundo con una GPU moderna. Para uso práctico en desarrollo, una GPU con al menos 8 GB de VRAM (como una RTX 3070 o equivalente) marca una diferencia notable. En Mac con Apple Silicon, la memoria unificada actúa como VRAM y el rendimiento es excelente incluso en los chips M1 de menor gama.
¿Puedo usar Ollama con LangChain o LlamaIndex?
Sí, ambas bibliotecas tienen soporte nativo para Ollama. LangChain tiene la clase
ChatOllama y OllamaEmbeddings. LlamaIndex tiene
Ollama como proveedor de LLM. También puedes usar el endpoint compatible
con OpenAI directamente con el SDK de OpenAI apuntando a http://localhost:11434/v1/.
Cualquier herramienta que soporte la API de OpenAI funciona con Ollama con solo cambiar
la URL base y el nombre del modelo.
¿Cuántos modelos puedo tener instalados a la vez?
Tantos como espacio en disco tengas. Ollama almacena los modelos en
~/.ollama/models/ y no hay límite en el número de modelos instalados.
Solo un modelo está cargado en VRAM a la vez (por defecto). Si ejecutas una petición
a un modelo diferente, Ollama desaloja el anterior de VRAM y carga el nuevo. Con la
variable de entorno OLLAMA_MAX_LOADED_MODELS puedes aumentar el número
de modelos que se mantienen en VRAM simultáneamente.
¿Cómo expongo Ollama a otros dispositivos de mi red?
Por defecto, Ollama solo escucha en 127.0.0.1:11434 (localhost).
Para exponerlo en tu red local, configura la variable de entorno
OLLAMA_HOST=0.0.0.0:11434 antes de arrancar el servicio.
En Linux con systemd: sudo systemctl edit ollama y agrega
Environment="OLLAMA_HOST=0.0.0.0". En macOS puedes configurarlo
en las Preferencias de la aplicación o mediante launchd. No expongas Ollama a
internet sin autenticación adicional: el servidor no incluye autenticación por defecto.
¿Qué diferencia hay entre Ollama y usar la API de OpenAI directamente?
La diferencia principal es dónde se ejecuta el modelo: con la API de OpenAI, el modelo corre en los servidores de OpenAI y tú pagas por token. Con Ollama, el modelo corre en tu hardware y no hay coste por petición. Las consecuencias prácticas son: con Ollama tienes privacidad total (nada sale de tu máquina), coste fijo independiente del volumen y control total sobre el modelo. A cambio, la calidad del modelo suele ser inferior a los modelos frontier de OpenAI (GPT-5, o3) salvo que uses los modelos de 70B o mayores, y necesitas hardware capaz de ejecutarlos.
Profundiza en Ollama
Guías detalladas sobre cada aspecto de Ollama: instalación paso a paso, catálogo de modelos, integración vía API, despliegue con Docker y uso con DeepSeek.