IA local · Ollama Official Documentation & Community Sources
Ejecuta modelos de IA localmente con Ollama - 2026
Foto: Nakul en Unsplash
Ollama es una herramienta de código abierto que te permite descargar, ejecutar y gestionar modelos de lenguaje grandes en tu máquina local, funcionando como Docker para modelos de IA: descargas un modelo con un solo comando y se encarga automáticamente de la cuantización, la gestión de memoria y la aceleración por GPU. La privacidad, el coste y el control son las tres razones principales por las que la gente ejecuta IA local con Ollama, y ha acumulado más de 112 millones de descargas de modelos solo con Llama 3.1 y ha recaudado 88 millones de dólares en financiación para agosto de 2026.
¿Qué es Ollama?
Ollama es una herramienta de código abierto que te permite descargar, ejecutar y gestionar modelos de lenguaje grandes en tu máquina local, encargándose automáticamente de la cuantización, la gestión de memoria y la aceleración por GPU. Publicado el 8 de julio de 2023, Ollama está desarrollado por Jeffrey Morgan y Michael Chiang y se distribuye bajo licencia MIT. Ollama incluye una API REST para ejecutar y gestionar modelos, lo que lo hace flexible tanto para su uso desde la CLI como para su integración programática.
Ollama ofrece una biblioteca de modelos activa con cientos de modelos disponibles y actualizados con regularidad, funciona multiplataforma en macOS, Windows y Linux, y utiliza automáticamente las GPU de Apple Silicon, NVIDIA y AMD cuando están disponibles. La privacidad, el coste y el control son las tres razones principales por las que la gente sigue volviendo a la IA local con Ollama.
Instalación y configuración
Requisitos del sistema
Verifica que tu hardware cumple los requisitos mínimos: 16 GB de RAM, una CPU o GPU moderna con suficiente VRAM para el tamaño del modelo que quieras usar. Con más detalle:
- 8 GB de RAM es el mínimo para modelos pequeños (1B, 3B, 7B), aunque el rendimiento puede resentirse; se recomiendan 16 GB para un rendimiento fluido con modelos de 7B y 13B.
- 32 GB o más es lo óptimo para modelos más grandes (30B, 40B, 70B).
- Las distribuciones de Linux compatibles incluyen Ubuntu 22.04/24.04 LTS, Debian 11/12, Fedora 39/40, RHEL 9+, Rocky Linux, AlmaLinux y Arch Linux; la arquitectura debe ser x86_64 (AMD64) o ARM64 (aarch64); se recomienda encarecidamente el kernel de Linux 5.15 o superior.
- La propia aplicación de Ollama es una descarga de unos 180 MB en macOS, un instalador de unos 1,6 GB en Windows y un paquete de unos 1,4 GB en Linux.
Compatibilidad con GPU
- Ollama es compatible con GPU NVIDIA mediante CUDA y con GPU AMD mediante ROCm en Windows; si tienes una GPU compatible, Ollama la detecta y la utiliza automáticamente sin necesidad de configuración manual en la mayoría de los casos.
- Para la aceleración por GPU NVIDIA, el controlador de NVIDIA debe estar instalado y funcionar; se requiere la versión 525+ del controlador, y se recomienda la 550+.
- En Linux, los usuarios de NVIDIA necesitan instalar los controladores CUDA por separado; la compatibilidad con GPU AMD mediante ROCm requiere por lo general la serie RX 5000 o posterior.
Pasos de instalación
Instala Ollama mediante Homebrew (macOS), el script oficial de instalación (Linux) o winget (Windows). Ejemplos:
- Linux:
curl -fsSL https://ollama.com/install.sh | sh - macOS:
brew install ollama - Windows: Descárgalo desde ollama.com o usa
winget install Ollama.Ollama
Modelos compatibles
El catálogo completo de modelos está disponible en ollama.com/library; usa ollama list para ver los modelos que tienes en tu máquina.
Modelos más recomendados por categoría (2026):
- Pequeños, rápidos, 8 GB de RAM: Llama 3.2 3B, Phi-3 Mini, Gemma 3 4B
- Mejor opción polivalente, 16 GB de RAM: Llama 3.1 8B, Qwen 2.5 7B, Mistral 7B
- Alta calidad, 32 GB+ / GPU: Gemma 2 27B, Qwen 2.5 32B, Mixtral 8x7B
- Lanzamientos recientes: Entre los principales lanzamientos de 2026 se incluyen Alibaba Qwen3.8-27B (agosto, el mejor en conjunto), Poolside Laguna XS 2.1 (julio), Google Gemma 4 (junio) y DeepSeek V4/Flash (abril).
Ollama descarga por defecto una versión cuantizada a 4 bits, y por eso un modelo '70B' puede caber en una buena estación de trabajo y uno '8B' funciona en un portátil.
Ventajas
- Coste cero y código abierto: Ollama es gratuito y de código abierto bajo licencia MIT; no hay un nivel de pago del propio proyecto, aunque pagas por el hardware en el que se ejecuta.
- Privacidad completa: Tus datos se quedan en tu máquina. Sin dependencia de la nube, sin factura por token.
- Configuración rápida: Poner en marcha un modelo de lenguaje competente en tu propia máquina lleva menos de diez minutos.
- Compatibilidad con OpenAI: Ollama tiene compatibilidad integrada con la API Chat Completions de OpenAI, lo que permite usar más herramientas y aplicaciones con Ollama en local.
- Aceleración automática por GPU: Si tienes una GPU compatible, Ollama la detecta y la utiliza automáticamente.
- Múltiples opciones de interfaz: Los usuarios pueden ejecutar modelos desde la línea de comandos, interactuar con ellos a través de una API HTTP local o usar bibliotecas cliente para Python y JavaScript.
Inconvenientes
- Enfoque centrado en la CLI: Cada interacción requiere comandos de terminal; no hay interfaz gráfica, ni explorador visual de modelos, ni sencillez de un solo clic.
- Curva de aprendizaje pronunciada para usuarios no técnicos: Ollama se basa únicamente en una interfaz de línea de comandos y tiene una curva de aprendizaje pronunciada, sobre todo para principiantes o usuarios no técnicos que prefieren una gestión visual de los modelos.
- Sin interfaz de chat integrada: Ollama no incluye una interfaz gráfica de chat; interactúas mediante comandos de terminal o instalas y configuras interfaces web de terceros.
- Funciones empresariales limitadas: Ollama carece de funciones empresariales integrales, como compatibilidad para despliegues a gran escala, herramientas colaborativas y herramientas de seguridad; no es adecuado para empresas con infraestructuras complejas o requisitos de cumplimiento extensos.
- Rendimiento más lento que la nube: Los modelos locales se ejecutan bastante más despacio que las alternativas en la nube, con tiempos de espera de 10 a 30 segundos para respuestas básicas.
- Personalización limitada: Ollama apuesta por la simplicidad a costa de la personalización; si te gusta ajustar cada detalle de un modelo, Ollama puede resultarte demasiado restrictivo.
- Sin historial de conversaciones integrado: Ollama en sí no guarda el historial de conversaciones; o usas una interfaz externa que lo gestione o pierdes tus conversaciones al cerrar el terminal.
Mejores casos de uso
- Desarrollo local y prototipado: Usa Ollama cuando quieras ejecutar un LLM de forma privada en tu propio hardware, para trabajo sin conexión, datos sensibles, prototipado local o como backend de inferencia sin coste detrás de una aplicación.
- Asistencia de código y flujos RAG: Ollama maneja con fluidez modelos de 7B-14B a 30-60 tokens/seg, suficiente para asistencia de código, chat y flujos RAG.
- Flujos de trabajo críticos para la privacidad: Los mandatos de privacidad de datos, los precios impredecibles de las API y la creciente necesidad de flujos de trabajo aptos para uso sin conexión impulsan su adopción.
- IA integrada en aplicaciones: Al implementar la interfaz de OpenAI, Ollama se convierte en un backend que puede sustituir directamente a todo el ecosistema de herramientas creadas para la API de OpenAI sin necesitar compatibilidad explícita con Ollama.
Preguntas frecuentes
¿Ollama es completamente gratuito?
Sí, Ollama es gratuito y de código abierto bajo la licencia MIT. Ollama es completamente gratuito, sin cuotas de suscripción, límites de uso ni costes ocultos por el software en sí.
¿Cuál es la diferencia entre Ollama y las API de IA en la nube como OpenAI?
Ollama cambia calidad de modelo de frontera por privacidad, uso sin conexión y coste cero por token; tú aportas el hardware. Ollama es excelente para el desarrollo local, pero no sustituye a una puerta de enlace de API de IA gestionada a menos que tu aplicación pueda tolerar las limitaciones de ejecución local.
¿Puedo usar la API compatible con OpenAI de Ollama con código existente?
El SDK de OpenAI para Python funciona con Ollama estableciendo base_url='http://localhost:11434/v1' y api_key='ollama', lo que redirige todas las llamadas a la API hacia tu instancia local de Ollama sin ningún cambio de código en el resto de tu aplicación. Puedes hacer prototipos con la API real de OpenAI durante el desarrollo y cambiar a Ollama para producción o despliegues sensibles a la privacidad con cambios mínimos en el código.
¿Qué modelos debería ejecutar en un portátil típico (8-16 GB de RAM)?
En cualquier portátil con 8 GB de RAM, ejecuta Llama 3.2 3B, Phi-3 Mini o Gemma 3 4B; para 16 GB de RAM (la mejor opción polivalente), usa Llama 3.1 8B, Qwen 2.5 7B o Mistral 7B.
Fuentes y créditos
Fuente original: Ollama Official Documentation & Community Sources