IA local · Hugging Face & Alibaba Qwen Official
Qwen 2.5: Guía completa del LLM abierto de Alibaba
Foto: Bhautik Patel en Unsplash
Qwen2.5 es la última serie de grandes modelos de lenguaje Qwen, disponible en 7 tamaños de 0,5B a 72B parámetros. Los modelos se entrenan con 18 billones de tokens y admiten más de 29 idiomas, con licencia Apache 2.0 para la mayoría de los tamaños. Qwen2.5 aporta capacidades notablemente mejoradas en programación y matemáticas, gracias a modelos expertos especializados en estos dominios.
¿Qué es Qwen 2.5?
Qwen2.5 es la última serie de grandes modelos de lenguaje Qwen. Construido sobre 18 billones de tokens y sofisticadas técnicas de post-entrenamiento que incluyen ajuste fino supervisado y aprendizaje por refuerzo en múltiples etapas, Qwen2.5 representa el impulso de Alibaba por crear modelos de peso abierto competitivos que rivalicen con sistemas propietarios más grandes.
Qwen2.5 aporta capacidades notablemente mejoradas en programación y matemáticas, gracias a modelos expertos especializados en estos dominios. Demuestra avances significativos en el seguimiento de instrucciones, la generación de texto largo (más de 8K tokens), la comprensión de datos estructurados (por ejemplo, tablas) y la generación de salidas estructuradas, especialmente en formato JSON.
Tamaños y variantes disponibles
Qwen2.5 ofrece modelos preentrenados y ajustados por instrucciones en 7 tamaños: 0,5B, 1,5B, 3B, 7B, 14B, 32B y 72B. Más de 100 modelos están disponibles en un solo lanzamiento, incluidas variantes base e instruct en siete tamaños de parámetros, además de variantes especializadas Qwen2.5-Coder y Qwen2.5-Math, y versiones cuantizadas GGUF, AWQ y GPTQ.
Modelos base frente a modelos ajustados por instrucciones:
- Los modelos base están preentrenados y son adecuados para un ajuste fino continuado
- Las variantes ajustadas por instrucciones están optimizadas para el chat y la conversación (recomendadas para la mayoría de los usuarios)
Variantes especializadas:
- Qwen2.5-Coder está diseñado específicamente para aplicaciones de programación
- Qwen2.5-Math ofrece ajustes finos especializados en razonamiento matemático con un pipeline de razonamiento en cadena de pensamiento + razonamiento integrado con herramientas
Licencias:
- La mayoría de los modelos tienen licencia Apache 2.0, mientras que Qwen2.5-3B y Qwen2.5-72B se rigen por la Qwen Research License y la Qwen License respectivamente
Requisitos de hardware
El rango de 0,5B (portátil/teléfono/Raspberry Pi) a 72B (insignia de doble 3090) significa que hay una variante de Qwen 2.5 para cada configuración. Estos son los requisitos típicos de VRAM en las cuantizaciones populares:
| Modelo | Q4_K_M (recomendado) | FP16 (precisión completa) | GPU mínima |
|---|---|---|---|
| 0,5B | ~400 MB | ~1 GB | Raspberry Pi 5 / Teléfono |
| 1,5B | ~1,5 GB | ~3 GB | 4 GB de RAM |
| 3B | ~2 GB | ~6 GB | 8 GB de RAM |
| 7B | ~5,5 GB | ~14 GB | RTX 4060 (8 GB) |
| 14B | ~8,5 GB | ~28 GB | RTX 4070 (12 GB) |
| 32B | ~19,5 GB | ~64 GB | RTX 4090 (24 GB) |
| 72B | ~45 GB | ~144 GB | Doble A100 (40 GB) |
La mayoría de los modelos admiten una longitud de contexto de 128K (131.072) tokens y pueden generar hasta 8K tokens, lo que permite producir salidas de texto extensas.
Consejos de cuantización:
- Q4_K_M es el punto óptimo recomendado entre calidad y consumo de VRAM
- Q8_0 conserva más precisión pero requiere el doble de VRAM
- Las cuantizaciones Q3/Q2 son alternativas de emergencia para memoria ajustada
Aspectos destacados de los benchmarks
Qwen2.5 muestra un rendimiento competitivo en las evaluaciones estándar:
- En el benchmark MATH, las puntuaciones de Qwen2.5-7B/72B-Instruct han aumentado de 52,9/69,0 a 75,5/83,1
- Qwen2.5-72B sobresale en tareas generales como MMLU y BBH, alcanzando puntuaciones de 79,7 y 78,2, superando a competidores de mayor tamaño
- Qwen2.5-14B y Qwen2.5-32B superan a modelos de referencia de tamaños comparables o mayores, logrando un equilibrio óptimo entre tamaño del modelo y capacidad
Rendimiento en programación:
- Qwen 2.5-Coder-32B obtiene un 37,2 % en LiveCodeBench, superando el 29,2 % de GPT-4o
- La puntuación del 36,5 % del modelo de 72B en SWE-Bench Verified (corrección de errores del mundo real) supera el 23,6 % de GPT-4o y el 33,4 % de Claude 3.5 Sonnet
Cómo ejecutarlo localmente
Inicio más rápido con Ollama:
Instala e inicia Qwen2.5-7B con: ollama pull qwen2.5:7b
El tamaño de 7B es la opción más popular para máquinas locales: equilibra calidad, velocidad y requisitos de hardware.
Otras herramientas: Además de Ollama, LM Studio ofrece una interfaz similar a ChatGPT para modelos locales. Otras opciones incluyen:
- Jan: interfaz de escritorio sencilla
- GPT4All: gestión de modelos en un clic
- Msty: alternativa ligera
Todas descargan los modelos directamente de Hugging Face una vez instaladas.
Integración directa con Python: Para flujos de trabajo personalizados, carga cualquier modelo mediante Hugging Face Transformers:
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B-Instruct")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-7B-Instruct")
Mejores casos de uso
-
Soporte multilingüe (más de 29 idiomas): Qwen2.5 admite más de 29 idiomas, incluidos chino, inglés, francés, español, portugués, alemán, italiano, ruso, japonés, coreano, vietnamita, tailandés y árabe. Ideal para equipos internacionales.
-
Despliegue en el borde y móvil: incluso los modelos de tan solo 3 mil millones de parámetros ofrecen ahora resultados muy competitivos. Los tamaños de 0,5B y 1,5B se ejecutan en teléfonos y dispositivos embebidos.
-
Generación y corrección de código: las variantes Qwen2.5-Coder superan a modelos abiertos más grandes. Úsalas para funciones tipo GitHub Copilot sin servicios en la nube propietarios.
-
Recuperación de contexto largo (RAG): un modelo de 3B con contexto de 128K es una oferta inusual (la mayoría de los modelos por debajo de 5B se limitan a 8-32K de contexto), lo que convierte a Qwen 2.5 3B en un candidato creíble para flujos de trabajo RAG en el dispositivo donde el contexto recuperado puede ser largo.
-
Aplicaciones críticas para la privacidad: ejecutar Qwen localmente garantiza la privacidad y elimina los costes de API.
Preguntas frecuentes
¿Qué tamaño de Qwen 2.5 debo elegir para mi portátil?
Qwen2.5-7B necesita unos 5,5 GB de VRAM y se ejecuta a aproximadamente 60-75 tokens/seg en una RTX 4060/4070. Si tienes una GPU de 8 GB, el modelo de 7B es ideal. Para 12 GB o más, la variante de 14B ofrece una calidad notablemente mejor a velocidades ligeramente más lentas.
¿Es Qwen 2.5 realmente de código abierto?
La mayoría de los modelos tienen licencia Apache 2.0, mientras que Qwen2.5-3B y Qwen2.5-72B se rigen por la Qwen Research License y la Qwen License respectivamente. Apache 2.0 permite el uso comercial; las otras dos licencias permiten el uso investigador y comercial con algunas restricciones: consulta los términos de la licencia en Hugging Face antes de desplegar comercialmente.
¿Cómo se compara Qwen 2.5 con Llama 3.1?
Qwen 2.5 72B supera a Llama 3.1 405B en varios benchmarks con un quinto de los parámetros activos. El 405B de Meta era el mayor insignia abierto cuando se lanzó, pero Qwen 2.5 tiene las pruebas que muestran un mejor rendimiento en muchas pruebas estándar.
¿Puedo ejecutar Qwen 2.5 en mi Mac?
Sí. Cualquier Mac de la serie M con 18 GB o más de memoria unificada puede ejecutar Qwen2.5-Coder 14B en Q5_K_M o superior. El M4 Pro de 24 GB ofrece una experiencia sólida en Q6_K con margen para el contexto. Los modelos Qwen2.5 base tienen requisitos similares o menores.
Fuentes y créditos
Fuente original: Hugging Face & Alibaba Qwen Official