Reupload
Tester mon PC
Retour à l'accueil

IA locale · Mistral AI, Hugging Face, ArXiv

Mistral & Mixtral : exécuter des LLM à poids ouverts

Mistral & Mixtral : exécuter des LLM à poids ouverts

Photo: Sandip Kalal sur Unsplash

Mistral AI a publié son premier modèle MoE ouvert en décembre 2023, établissant une réputation de modèles de langage efficaces qui dépassent leur nombre de paramètres. Mixtral 8x7B contient 46,7 milliards de paramètres au total mais réalise l'inférence à la même vitesse et au même coût que des modèles trois fois plus petits, et les variantes plus récentes restent disponibles sous licence Apache 2.0, permettant un déploiement privé et personnalisable de l'IA sur du matériel grand public.

Qu'est-ce que Mistral / Mixtral ?

Mistral Large 3 est l'un des meilleurs modèles à poids ouverts permissifs au monde et le premier modèle à mélange d'experts de Mistral depuis la série fondatrice Mixtral. La famille Mistral englobe à la fois des modèles denses (7B, 24B, 128B) et des variantes creuses de type Mixture-of-Experts. Mixtral 8x7B utilise 8 réseaux experts de 7 milliards de paramètres chacun, avec seulement 2 experts activés par token, ce qui signifie que vous obtenez environ 13 milliards de paramètres actifs tout en bénéficiant de 47 milliards de paramètres au total.

La famille de modèles Mixtral emploie une architecture creuse de mélange d'experts (SMoE) où un routeur sélectionne un sous-ensemble de réseaux experts pour traiter chaque token. Cette conception offre une efficacité exceptionnelle : Mixtral 8x7B offre une qualité proche d'un modèle dense de 70B mais au coût d'inférence d'un modèle de 13B.

Tailles et variantes disponibles

La gamme à poids ouverts Mistral / Mixtral comprend :

  • Mistral 7B - Un modèle de texte génératif pré-entraîné de 7 milliards de paramètres, disponible en variantes de base et instruct
  • Mixtral 8x7B - 46,7 milliards de paramètres au total, réalisant l'inférence à la même vitesse et au même coût que des modèles trois fois plus petits, avec une longueur de contexte de 32k tokens
  • Mixtral 8x22B - Mélange d'experts creux avec 39 milliards de paramètres actifs sur 141 milliards de paramètres au total, avec une fenêtre de contexte de 64K tokens
  • Mistral Small 3.1 - 24 milliards de paramètres avec une compréhension visuelle de pointe et des capacités de contexte de 128k tokens
  • Mistral Large 3 - Modèle à mélange d'experts granulaire multimodal polyvalent de pointe, avec 41 milliards de paramètres actifs et 675 milliards de paramètres au total

Toutes les variantes à poids ouverts sont publiées sous licence Apache 2.0, permettant une utilisation de recherche et commerciale sans restriction.

Configuration matérielle requise

Les besoins en VRAM varient considérablement selon la taille du modèle et la quantification :

  • Mistral 7B : 6-8 Go de VRAM avec quantification Q4 ou Q5
  • Mixtral 8x7B : 24 Go de VRAM pour la quantification Q4 (~28,4 Go de poids avec déport partiel)
  • Mixtral 8x22B : 48 Go et plus de VRAM pour Q4 (~85,9 Go de poids, ~97 Go au total)

Les modèles MoE doivent conserver tous les experts en VRAM même si seuls quelques-uns s'activent par token. Mixtral 8x7B en quantification 4 bits nécessite environ 28 Go et tient sur une seule NVIDIA RTX 5090 32 Go.

Pour les spécifications au niveau du système : 16 Go de RAM minimum (32 Go recommandés), n'importe quel CPU moderne à 8 cœurs, et un SSD NVMe avec 100-500 Go d'espace libre pour les fichiers de modèle. Mac (Apple Silicon) excelle grâce à la mémoire unifiée et au runtime MLX, Windows est optimal avec NVIDIA + CUDA, et Linux offre la plus grande flexibilité GPU, y compris la prise en charge d'AMD ROCm.

Points forts des benchmarks

Mixtral 8x7B a surpassé Llama 2 70B sur neuf des douze benchmarks. Plus précisément, Mixtral surpasse nettement Llama 2 70B en français, allemand, espagnol et italien.

Mixtral 8x7B atteint ~70 % sur MMLU, ce qui est nettement mieux que Mistral 7B. Mixtral peut gérer 32k tokens de contexte, affiche de solides performances en génération de code, et avec 46,7 milliards de paramètres au total mais seulement 12,9 milliards utilisés par token, maintient à la fois la vitesse et l'efficacité en termes de coût.

Mistral 8x7B se classe à 43,1 sur les benchmarks récents, derrière Mistral Large 3 (45,7) et Ministral 3 14B Reasoning (47,3). Pour les capacités de pointe, Mistral Large 3 atteint la parité avec les meilleurs modèles à poids ouverts ajustés aux instructions sur les invites générales, tout en démontrant une compréhension des images et des performances de premier ordre sur les conversations multilingues, débutant à la 2e place dans la catégorie des modèles OSS non-raisonneurs du classement LMArena.

Comment l'exécuter localement

Le chemin le plus simple est Ollama, un runtime orienté ligne de commande avec un serveur d'arrière-plan léger et une API compatible OpenAI. Installez-le depuis ollama.com, puis exécutez :

ollama run mixtral:8x7b

Pour la variante 8x22B, utilisez : ollama run mixtral:8x22b. La bibliothèque d'Ollama répertorie plus de 200 modèles prêts à l'emploi couvrant Llama, Qwen, DeepSeek, Mistral, Gemma et la gamme à poids ouverts gpt-oss d'OpenAI, chacun préconfiguré avec le bon modèle d'invite.

Des outils alternatifs prennent également en charge les modèles Mistral / Mixtral :

  • LM Studio - Interface graphique de bureau soignée destinée à ceux qui préfèrent naviguer et cliquer plutôt que taper des commandes, et qui exécute aussi un serveur API local
  • Jan - L'une des applications LLM locales les plus populaires et les plus élégantes, une alternative respectueuse de la vie privée à ChatGPT
  • GPT4All - Le plus accessible aux débutants des trois, avec une liste de modèles plus restreinte et sélectionnée et une expérience d'installation en un clic plus simple

Ollama est construit au-dessus de llama.cpp, offrant un excellent débit de tokens par seconde avec une gestion intelligente de la mémoire et une accélération GPU efficace pour les GPU NVIDIA (CUDA), Apple Silicon (Metal) et AMD (ROCm).

Meilleurs cas d'usage

Mixtral 8x7B est idéal pour le résumé de texte, les questions-réponses, la classification de texte, la complétion de texte et la génération de code. Mistral 7B prend en charge le résumé de texte, la classification, la complétion de texte et la complétion de code.

Tâches de code et techniques : Mistral 7B approche les performances de CodeLlama 7B sur les tâches de code tout en restant très performant sur les tâches en langue anglaise. Mixtral 8x22B n'utilise que 39 milliards de paramètres actifs sur 141 milliards et offre une efficacité de coût inégalée, avec de solides capacités en mathématiques et en codage et un appel de fonctions natif.

Traitement de documents et RAG : La fenêtre de contexte de 64K tokens de Mixtral 8x22B permet un rappel précis des informations dans de grands documents, ce qui le rend excellent pour la génération augmentée par récupération et le résumé de longs documents.

Flux de travail multilingues : Mixtral 8x22B possède des capacités multilingues natives et surpasse nettement LLaMA 2 70B sur les benchmarks HellaSwag, Arc Challenge et MMLU en français, allemand, espagnol et italien.

Inférence en production : Mixtral 8x7B convient bien aux environnements de production nécessitant des modèles à poids ouverts pour la personnalisation ou l'ajustement fin lorsque les ressources de calcul ou la latence sont limitées.

FAQ

Puis-je exécuter Mixtral 8x7B sur mon PC de jeu ?

Oui, avec quelques réserves. Mixtral 8x7B en quantification 4 bits nécessite environ 28 Go et tient sur une seule NVIDIA RTX 5090 32 Go. Les cartes plus anciennes comme une RTX 3090 (24 Go) nécessitent des techniques de déport de couches. Commencez par Mistral 7B si vous disposez de 8 Go ; il se quantifie à ~4,4 Go.

Qu'est-ce qui est plus rapide : Mistral 7B dense ou Mixtral 8x7B creux ?

Mixtral 8x7B offre une qualité proche d'un modèle dense de 70B mais au coût d'inférence d'un modèle de 13B, car seuls 2 des 8 experts s'activent par token. Mistral 7B est plus petit et se charge plus vite, mais Mixtral offre une meilleure qualité à vitesse comparable grâce à son architecture creuse.

Les modèles Mistral peuvent-ils être utilisés à des fins commerciales en toute sécurité ?

Oui. Les versions de base et ajustées aux instructions sont publiées sous licence Apache 2.0, offrant une base solide pour une personnalisation poussée au sein des communautés d'entreprise et de développeurs. Aucune restriction de licence ne s'applique à un usage de recherche ou de production.

Comment Mixtral 8x22B se compare-t-il à Mistral Large 3 ?

Mixtral 8x22B est retiré depuis mars 2025, Mistral Small 4 étant recommandé pour les nouvelles intégrations. Mistral Large 3 est un modèle à mélange d'experts multimodal polyvalent de pointe avec 41 milliards de paramètres actifs et 675 milliards de paramètres au total, offrant des performances supérieures mais nécessitant 48 Go et plus de VRAM. Pour un déploiement local sur du matériel grand public, Mixtral 8x7B ou Mistral Small 3.1 restent le compromis pratique idéal.

Envie de savoir si votre ordinateur peut faire tourner une IA en local ?

Sources & crédits

Source originale: Mistral AI, Hugging Face, ArXiv