IA locale · Hugging Face & Alibaba Qwen Official
Qwen 2.5 : guide complet du LLM ouvert d'Alibaba
Photo: Bhautik Patel sur Unsplash
Qwen2.5 est la dernière série de grands modèles de langage Qwen, disponible en 7 tailles de 0,5B à 72B paramètres. Les modèles sont entraînés sur 18 billions de tokens et prennent en charge plus de 29 langues, avec une licence Apache 2.0 pour la plupart des tailles. Qwen2.5 apporte des capacités nettement améliorées en codage et en mathématiques, grâce à des modèles experts spécialisés dans ces domaines.
Qu'est-ce que Qwen 2.5 ?
Qwen2.5 est la dernière série de grands modèles de langage Qwen. Construit sur 18 billions de tokens et des techniques de post-entraînement sophistiquées, notamment l'ajustement fin supervisé et l'apprentissage par renforcement multi-étapes, Qwen2.5 représente la volonté d'Alibaba de créer des modèles à poids ouverts compétitifs qui rivalisent avec de plus grands systèmes propriétaires.
Qwen2.5 apporte des capacités nettement améliorées en codage et en mathématiques, grâce à des modèles experts spécialisés dans ces domaines. Il démontre des avancées significatives dans le suivi d'instructions, la génération de textes longs (plus de 8K tokens), la compréhension de données structurées (par exemple des tableaux) et la génération de sorties structurées, en particulier au format JSON.
Tailles et variantes disponibles
Qwen2.5 propose des modèles pré-entraînés et ajustés aux instructions en 7 tailles : 0,5B, 1,5B, 3B, 7B, 14B, 32B et 72B. Plus de 100 modèles sont disponibles en une seule livraison, y compris des variantes de base et instruct sur sept tailles de paramètres, ainsi que des variantes spécialisées Qwen2.5-Coder et Qwen2.5-Math, plus des versions quantifiées GGUF, AWQ et GPTQ.
Modèles de base vs ajustés aux instructions :
- Les modèles de base sont pré-entraînés et adaptés à un ajustement fin continu
- Les variantes ajustées aux instructions sont optimisées pour le chat et la conversation (recommandées pour la plupart des utilisateurs)
Variantes spécialisées :
- Qwen2.5-Coder est spécialement conçu pour les applications de codage
- Qwen2.5-Math propose des ajustements fins spécialisés en raisonnement mathématique avec un pipeline de raisonnement en chaîne de pensée + outils intégrés
Licences :
- La majorité des modèles sont sous licence Apache 2.0, tandis que Qwen2.5-3B et Qwen2.5-72B sont régis respectivement par la Qwen Research License et la Qwen License
Configuration matérielle requise
La gamme allant de 0,5B (ordinateur portable/téléphone/Pi) à 72B (fer de lance bi-3090) signifie qu'il existe une variante de Qwen 2.5 pour chaque configuration. Voici les besoins typiques en VRAM aux quantifications les plus courantes :
| Modèle | Q4_K_M (recommandé) | FP16 (pleine précision) | GPU minimum |
|---|---|---|---|
| 0,5B | ~400 Mo | ~1 Go | Raspberry Pi 5 / Téléphone |
| 1,5B | ~1,5 Go | ~3 Go | 4 Go de RAM |
| 3B | ~2 Go | ~6 Go | 8 Go de RAM |
| 7B | ~5,5 Go | ~14 Go | RTX 4060 (8 Go) |
| 14B | ~8,5 Go | ~28 Go | RTX 4070 (12 Go) |
| 32B | ~19,5 Go | ~64 Go | RTX 4090 (24 Go) |
| 72B | ~45 Go | ~144 Go | Double A100 (40 Go) |
La plupart des modèles prennent en charge une longueur de contexte de 128K (131 072) tokens et peuvent générer jusqu'à 8K tokens, permettant la production de sorties textuelles étendues.
Conseils de quantification :
- Q4_K_M est le compromis recommandé entre qualité et VRAM
- Q8_0 préserve davantage de précision mais nécessite 2x plus de VRAM
- Les quantifications Q3/Q2 sont des solutions de secours d'urgence pour une mémoire limitée
Points forts des benchmarks
Qwen2.5 affiche des performances compétitives sur les évaluations standards :
- Sur le benchmark MATH, les scores de Qwen2.5-7B/72B-Instruct sont passés de 52,9/69,0 à 75,5/83,1
- Qwen2.5-72B excelle dans les tâches générales comme MMLU et BBH, atteignant des scores de 79,7 et 78,2, surpassant des concurrents de plus grande taille
- Qwen2.5-14B et Qwen2.5-32B surpassent les modèles de référence de taille comparable ou supérieure, atteignant un équilibre optimal entre taille du modèle et capacité
Performances en codage :
- Qwen 2.5-Coder-32B obtient 37,2 % sur LiveCodeBench, battant les 29,2 % de GPT-4o
- Le score de 36,5 % du modèle 72B sur SWE-Bench Verified (correction de bugs en conditions réelles) dépasse les 23,6 % de GPT-4o et les 33,4 % de Claude 3.5 Sonnet
Comment l'exécuter localement
Démarrage le plus rapide avec Ollama :
Installez et lancez Qwen2.5-7B avec : ollama pull qwen2.5:7b
La taille 7B est le choix le plus populaire pour les machines locales - elle équilibre qualité, vitesse et besoins matériels.
Autres outils : Au-delà d'Ollama, LM Studio fournit une interface de type ChatGPT pour les modèles locaux. D'autres options incluent :
- Jan - Interface de bureau simple
- GPT4All - Gestion des modèles en un clic
- Msty - Alternative légère
Tous téléchargent les modèles directement depuis Hugging Face une fois installés.
Intégration Python directe : Pour des flux de travail personnalisés, chargez n'importe quel modèle via Hugging Face Transformers :
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B-Instruct")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-7B-Instruct")
Meilleurs cas d'usage
-
Support multilingue (plus de 29 langues) : Qwen2.5 prend en charge plus de 29 langues, dont le chinois, l'anglais, le français, l'espagnol, le portugais, l'allemand, l'italien, le russe, le japonais, le coréen, le vietnamien, le thaï et l'arabe. Idéal pour les équipes internationales.
-
Déploiement en périphérie et sur mobile : Même les modèles de seulement 3 milliards de paramètres offrent désormais des résultats hautement compétitifs. Les tailles 0,5B et 1,5B tournent sur des téléphones et des appareils embarqués.
-
Génération et correction de code : Les variantes Qwen2.5-Coder surpassent des modèles ouverts plus grands. À utiliser pour des fonctionnalités de type GitHub Copilot sans services cloud propriétaires.
-
Récupération à long contexte (RAG) : Un modèle 3B avec un contexte de 128K est une offre inhabituelle - la plupart des modèles de moins de 5B plafonnent à 8-32K de contexte - ce qui fait de Qwen 2.5 3B un candidat crédible pour les flux de travail RAG embarqués où le contexte récupéré peut être long.
-
Applications critiques en matière de confidentialité : Exécuter Qwen localement garantit la confidentialité et élimine les coûts d'API.
FAQ
Quelle taille de Qwen 2.5 choisir pour mon ordinateur portable ?
Qwen2.5-7B nécessite environ 5,5 Go de VRAM et tourne à environ 60-75 tokens/sec sur une RTX 4060/4070. Si vous avez un GPU de 8 Go, le modèle 7B est idéal. Pour 12 Go et plus, la variante 14B offre une qualité nettement meilleure à des vitesses légèrement plus lentes.
Qwen 2.5 est-il vraiment open source ?
La majorité des modèles sont sous licence Apache 2.0, tandis que Qwen2.5-3B et Qwen2.5-72B sont régis respectivement par la Qwen Research License et la Qwen License. Apache 2.0 autorise l'usage commercial ; les deux autres licences permettent un usage de recherche et commercial avec certaines restrictions - vérifiez les termes de la licence sur Hugging Face avant tout déploiement commercial.
Comment Qwen 2.5 se compare-t-il à Llama 3.1 ?
Qwen 2.5 72B surpasse Llama 3.1 405B sur plusieurs benchmarks avec un cinquième des paramètres actifs. Le 405B de Meta était le plus grand fer de lance ouvert lors de sa sortie, mais Qwen 2.5 a les preuves montrant de meilleures performances sur de nombreux tests standards.
Puis-je exécuter Qwen 2.5 sur mon Mac ?
Oui. Tout Mac de la série M avec 18 Go ou plus de mémoire unifiée peut exécuter Qwen2.5-Coder 14B en Q5_K_M ou plus. Le M4 Pro 24 Go offre une expérience solide en Q6_K avec de la marge pour le contexte. Les modèles Qwen2.5 de base ont des besoins similaires ou inférieurs.
Sources & crédits
Source originale: Hugging Face & Alibaba Qwen Official