IA local · Official model documentation and technical reports (Hugging Face, Meta, Mistral AI, Alibaba, Microsoft, Google)
Comparativa de 5 LLM de peso abierto: Llama, Mistral, Qwen, Phi, Gemma
Foto: Umberto en Unsplash
Una comparación detallada de cinco grandes familias de modelos de lenguaje de peso abierto (Llama 3.2, Mistral/Mixtral, Qwen 2.5, Phi-4 y Gemma 2) que abarca tamaños de parámetros, longitudes de contexto, licencias y fortalezas clave. Esta guía ayuda a los desarrolladores a elegir el mejor modelo para sus limitaciones de hardware y casos de uso.
¿Por qué comparar estas 5 familias de modelos?
El panorama de los LLM de peso abierto ha explotado con opciones viables de los principales laboratorios de IA. Cada familia hace diferentes concesiones entre número de parámetros, ventana de contexto, velocidad de inferencia y capacidad de razonamiento. Ya sea que despliegues en dispositivos de borde, construyas un asistente de programación o proceses documentos multilingües, estas cinco familias representan la frontera de Pareto actual, y todas pueden ejecutarse localmente en hardware de consumo. Comprender sus especificaciones es esencial antes de descargar y desplegar.
Tabla comparativa
| Familia de modelos | Tamaños de parámetros | Contexto máximo | Licencia | Editor | Fortaleza destacada |
|---|---|---|---|---|---|
| Llama 3.2 | 1B, 3B, 11B*, 90B* | 128K | Llama Community | Meta | Despliegue en el dispositivo (1B/3B) |
| Mistral/Mixtral | 7B, 8x7B (46,7B en total) | 32K | Apache 2.0 | Mistral AI | Generación de código y velocidad de inferencia |
| Qwen 2.5 | 0,5B - 72B | 128K (1M Turbo) | Apache 2.0 | Alibaba | Manejo de contexto largo, multilingüe |
| Phi-4 | 3,8B, 14B, 5,6B* | 16K, 128K* | MIT | Microsoft | Calidad de razonamiento por parámetro |
| Gemma 2 | 2B, 9B, 27B | 8K | Gemma Terms | Modelos densos eficientes |
*Variantes de visión/multimodales. Llama 3.2 11B/90B añaden comprensión de imágenes; Phi-4 multimodal añade contexto de 128K; Gemma planea 256K en Gemma 4.
Llama 3.2 en breve
Llama 3.2 incluye LLM de visión pequeños y medianos (11B y 90B) y modelos ligeros solo de texto (1B y 3B). Los modelos de 1B y 3B admiten una longitud de contexto de 128K tokens y son de vanguardia en su clase para casos de uso en el dispositivo, como resumen, seguimiento de instrucciones y tareas de reescritura que se ejecutan localmente en el borde.
Especificaciones clave: entrenados con hasta 9 billones de tokens y admiten la longitud de contexto larga de 128k tokens. El uso de Llama 3.2 se rige por la Licencia Comunitaria de Llama 3.2 (un acuerdo de licencia comercial personalizado) con el requisito de solicitar una licencia a Meta si los usuarios activos mensuales superan los 700 millones.
Ideal para: despliegue móvil, resumen, IA en el borde, tareas de seguimiento de instrucciones en dispositivos con recursos limitados.
Mistral / Mixtral en breve
Mistral es un modelo de lenguaje de 7B parámetros, centrado en equilibrar los costes de escalado de los modelos grandes con el rendimiento y la inferencia eficiente. En cambio, Mixtral tiene 46,7B parámetros totales pero solo usa 12,9B parámetros por token, procesando la entrada y generando la salida a la misma velocidad y con el mismo coste que un modelo de 12,9B.
Especificaciones clave: Mixtral maneja con soltura un contexto de 32k tokens. Ambos tienen licencia Apache 2.0. Mixtral muestra un fuerte rendimiento en generación de código.
Ideal para: generación de código, inferencia eficiente en GPU modestas, optimización del coste por token, flujos de trabajo multilingües.
Qwen 2.5 en breve
La versión Qwen 2.5 incluye siete modelos de código abierto con tamaños que van de 0,5B a 72B. La mayoría de los modelos admiten una longitud de contexto de 128K (131.072) tokens y pueden generar hasta 8K tokens.
Especificaciones clave: entrenamiento con 18 billones de tokens y sofisticadas técnicas de post-entrenamiento, incluidos el ajuste fino supervisado y el aprendizaje por refuerzo en múltiples etapas. Los modelos Qwen se publican bajo la Licencia Apache 2.0, una licencia de código abierto permisiva que permite el uso, la modificación y la distribución gratuitos, incluido el uso comercial, y que exige preservar los avisos de copyright y las exenciones de responsabilidad. Contexto extendido disponible: Qwen2.5-1M es la versión de contexto largo que admite una longitud de contexto de hasta 1M tokens.
Ideal para: aplicaciones multilingües, procesamiento de documentos de contexto largo, seguimiento de instrucciones a escala (variante de 72B), razonamiento denso.
Phi-4 en breve
Microsoft Phi-4 es un modelo Transformer solo decodificador de 14 mil millones de parámetros, desarrollado para ofrecer capacidades de razonamiento avanzadas de forma eficiente, lo que permite su despliegue en entornos con recursos de cómputo y memoria limitados. Phi-4 admite una longitud de contexto de 16.000 tokens, lo que le permite procesar y generar contenido extenso de formato largo.
Especificaciones clave: entrenado con aproximadamente 10 billones (10T) de tokens. Phi-4 viene con una licencia MIT permisiva, que permite su uso en aplicaciones comerciales. Una innovación clave radica en su uso estratégico de datos sintéticos de alta calidad, que constituyen una parte significativa de su corpus de entrenamiento.
Ideal para: razonamiento matemático, problemas lógicos complejos, respuesta a preguntas científicas, despliegues comerciales con recursos limitados.
Gemma 2 en breve
Gemma 2 viene en dos tamaños, 9 mil millones y 27 mil millones de parámetros, con versiones base (preentrenadas) y ajustadas por instrucciones. Los modelos Gemma 2 se entrenaron con aproximadamente el doble de datos que su primera iteración, totalizando 13 billones de tokens para la versión de 27B y 8 billones de tokens para la versión de 9B de datos web (principalmente en inglés), código y matemáticas.
Especificaciones clave: longitud de contexto de 8192 tokens, uso de Embeddings de Posición Rotatoria (RoPE). Gemma 2 viene con una licencia permisiva que permite la redistribución, el ajuste fino, el uso comercial y las obras derivadas (Términos de Uso de Gemma personalizados). La atención de ventana deslizante se aplica a capas alternas (local, 4096 tokens), mientras que las capas intermedias siguen usando atención global cuadrática completa (8192 tokens), una forma de aumentar la calidad en situaciones de contexto largo beneficiándose parcialmente de las ventajas de la atención deslizante.
Ideal para: uso general equilibrado, despliegue en el dispositivo (2B), inferencia eficiente en TPU/GPU, educación e investigación.
¿Qué modelo deberías elegir?
Para hardware modesto (4-8 GB de VRAM o menos):
- Llama 3.2 1B si necesitas despliegue en el borde/móvil
- Phi-4-mini (3,8B) para mejor razonamiento en el mismo espacio
- Gemma 2 2B para chat ligero ajustado por instrucciones
Para hardware de gama media (12-24 GB de VRAM):
- Qwen 2.5 7B o Llama 3.2 3B para tareas de contexto largo
- Phi-4 14B para razonamiento matemático y programación
- Gemma 2 9B para un rendimiento general equilibrado y completo
Para tareas serias de programación:
- Mixtral 8x7B para la mejor generación de código con inferencia eficiente
- Qwen 2.5 32B-72B para generación de código compleja más razonamiento
- Phi-4 14B para diseño de algoritmos con alta carga matemática
Para trabajo multilingüe o entre idiomas:
- Qwen 2.5 (entrenado explícitamente en más de 29 idiomas)
- Mistral 7B/Mixtral (admite francés, alemán, español, italiano, inglés)
- Evita Gemma 2 a menos que sea aceptable el inglés como idioma principal
Para la máxima longitud de contexto:
- Qwen 2.5-Turbo o Qwen 2.5-1M (hasta 1M tokens, listo para producción a 128K)
- Variantes Qwen 2.5 de 128K (7B-72B)
- Variantes de Phi-4 de hasta 128K (versión multimodal)
Para despliegues comerciales con claridad de licencia:
- Phi-4 (MIT: cero restricciones más allá de la atribución)
- Mistral/Mixtral (Apache 2.0: permisiva, sin umbrales de usuarios)
- Qwen 2.5 (Apache 2.0: igual que Mistral)
- Evita: Llama (umbral de 700 M de MAU), Gemma (Términos personalizados con obligaciones de flujo descendente)
Para eficiencia pura (velocidad de inferencia + poca VRAM):
- Mistral 7B (atención de ventana deslizante)
- Mixtral 8x7B (MoE disperso: 13B activos por token)
- Phi-4-mini 3,8B (denso, datos de alta calidad)
Preguntas frecuentes
¿Puedo usar estos modelos comercialmente sin restricciones?
No por igual. Phi-4 viene con una licencia MIT permisiva, que permite su uso en aplicaciones comerciales. Mistral, Mixtral y Qwen 2.5 usan todos Apache 2.0 (sin restricciones). Llama 3.2 permite el uso comercial pero requiere una licencia aparte de Meta si tu producto supera los 700 millones de usuarios activos mensuales. Gemma 2 permite el despliegue comercial pero bajo Términos de Uso de Gemma personalizados, no una licencia de código abierto estándar.
¿Qué modelo se ejecuta en GPU de consumo como RTX 4090 o RTX 4070?
Phi-4 Multimodal, con 5,6B parámetros y una longitud de contexto de 128K tokens, está optimizado tanto para la ejecución en el dispositivo como para la inferencia de baja latencia. Qwen 2.5 7B-14B, Mistral 7B, Llama 3.2 3B y Gemma 2 9B se cuantizan para caber eficientemente en 12-24 GB de VRAM. Para una mejor compatibilidad, usa cuantización de 4 u 8 bits (formato GGUF, AWQ o bitsandbytes).
¿Cómo se comparan realmente las longitudes de contexto para el trabajo real con documentos?
La mayoría de los modelos Qwen 2.5 admiten una longitud de contexto de 128K (131.072) tokens y pueden generar hasta 8K tokens, igual que Llama 3.2. Mistral y Mixtral se limitan a 32K. Gemma 2 se limita a 8K, lo que lo hace inadecuado para el procesamiento de documentos completos; los 16K de Phi-4 son mejores pero aún modestos. Para el uso de contexto largo en producción, Qwen 2.5 es el claro ganador.
¿Son los datos de entrenamiento sintéticos (Phi-4) mejores que los datos diversos de internet?
Depende de la tarea. El uso estratégico que hace Phi-4 de datos sintéticos de alta calidad, generados mediante técnicas como el prompting multiagente, la inversión de instrucciones y los flujos de trabajo de autorrevisión, le permite adquirir sólidas capacidades de razonamiento y resolución de problemas, superando a menudo a modelos con mayor número de parámetros. Esto funciona excepcionalmente bien para matemáticas, lógica y código, y menos para tareas creativas abiertas o factuales, donde el amplio entrenamiento de Qwen 2.5 o Llama destaca.
Fuentes y créditos
Fuente original: Official model documentation and technical reports (Hugging Face, Meta, Mistral AI, Alibaba, Microsoft, Google)