IA locale · Microsoft Foundry Labs + Hugging Face
Phi-4 : le puissant modèle de raisonnement 14B de Microsoft
Photo: Shubham Dhage sur Unsplash
Phi-4 est le petit modèle de langage de 14 milliards de paramètres de Microsoft, entraîné sur 9,8 billions de tokens de données synthétiques et organiques soigneusement sélectionnées, atteignant des performances exceptionnelles sur les benchmarks de raisonnement et de mathématiques. Disponible en plusieurs tailles (14B, 3,8B mini, 5,6B multimodal), il s'exécute localement sur du matériel grand public via Ollama, LM Studio et d'autres outils, avec une licence MIT autorisant l'usage commercial.
Qu'est-ce que Phi-4 ?
Phi-4 est le petit modèle de langage de 14 milliards de paramètres de Microsoft, entraîné sur environ 9,8 billions de tokens de données synthétiques de type « manuel scolaire » combinées à des documents publics filtrés et à du matériel académique sélectionné. Le modèle est aligné à l'aide d'un ajustement fin supervisé et d'une optimisation directe des préférences, avec une fenêtre de contexte de 16K tokens.
Phi-4 est publié sous licence MIT, ce qui le rend librement utilisable à des fins commerciales et de recherche. Le modèle est conçu pour le raisonnement, les mathématiques et la génération de code dans des environnements à mémoire limitée, atteignant 84,8 % sur MMLU, 80,4 % sur MATH et 82,6 % sur HumanEval.
Tailles et variantes disponibles
La famille Phi-4 comprend trois modèles principaux :
- Phi-4 (14B) - Le modèle phare optimisé pour le raisonnement complexe et la résolution de problèmes mathématiques, avec une fenêtre de contexte de 16K tokens.
- Phi-4-mini (3,8B) - optimisé pour le raisonnement et les tâches à contexte de 128K. Ce modèle dispose d'un vocabulaire de 200 000 mots permettant un support multilingue accru, d'une attention à requêtes groupées, d'un appel de fonctions intégré, d'un meilleur suivi d'instructions et d'un embedding partagé.
- Phi-4-multimodal (5,6B) - unifiant la parole, la vision et le texte dans une seule architecture. Il prend en charge le texte, l'audio et l'image en entrée, tout en renvoyant du texte en sortie.
De plus, Microsoft a publié des variantes de raisonnement spécialisées optimisées pour les tâches mathématiques et logiques avancées.
Configuration matérielle requise
Inférence sur GPU (recommandée) :
- Phi-4 (14B) en Q4_K_M nécessite environ 9 Go de VRAM. En Q8, il nécessite environ 14 Go. En FP16, il nécessite environ 28 Go.
- Phi-4-mini (3,8B) en Q4_K_M ne nécessite qu'environ 2,5 Go - il tient sur n'importe quel GPU ou tourne uniquement sur CPU.
- Recommandé : 12 Go de VRAM (RTX 4070, RTX 3060 12 Go) en Q5_K_M pour le meilleur rapport qualité/performance.
Inférence sur CPU uniquement :
- Minimum : 16 Go de RAM système pour une inférence sur CPU uniquement.
- Attendez-vous à une fraction de la vitesse GPU, ce qui convient aux tâches d'arrière-plan ou par lots mais reste lent pour un chat interactif.
RAM système :
- Windows 10/11, 16 Go de RAM minimum (32 Go recommandés).
Points forts des benchmarks
Phi-4 atteint 84,8 % sur MMLU, 80,4 % sur MATH et 82,6 % sur HumanEval. Sur 13 benchmarks, Phi-4 surpasse Llama 3.3 70B (son concurrent à poids ouverts le plus récent) sur six d'entre eux et Qwen 2.5 sur cinq.
Phi-4 surpasse Llama 3.3 70B, Qwen 2.5 et GPT-4o sur GPQA (questions et réponses de niveau universitaire) et MATH (problèmes mathématiques de niveau compétition). Sur GPQA (questions STEM de niveau universitaire) et MATH (compétitions mathématiques), il dépasse même son modèle enseignant, GPT-40. Il obtient également de meilleurs scores en codage, mesurés par HumanEval et HumanEval+, que tout autre modèle à poids ouverts.
Phi-4 a une date limite de connaissances de juin 2024. Les données d'entraînement du modèle incluent des informations jusqu'à cette date.
Comment l'exécuter localement
Avec Ollama (recommandé - le plus simple) :
Ouvrez votre terminal et exécutez la commande ollama run phi4. Cette commande effectue deux actions : elle télécharge les poids du modèle depuis la bibliothèque Ollama et lance immédiatement une session de chat interactive.
Pour Phi-4-mini, utilisez : ollama run phi4-mini
Ollama gère automatiquement la détection du GPU sous Windows. Le GPU est détecté automatiquement sur NVIDIA, AMD (ROCm) et Apple Silicon. Ollama utilise Q4_K_M par défaut. Sur un GPU de 8 Go, il déportera automatiquement les couches en excès vers la RAM du CPU.
Avec LM Studio (basé sur une interface graphique) :
LM Studio 0.4.12 prend entièrement en charge Phi-4 et Phi-4-mini sur Windows 10 et 11. Il fournit une interface de chat, une comparaison de modèles et un mode serveur local avec une interface graphique - aucune ligne de commande requise. Recherchez simplement « Phi-4 » dans l'onglet Discover, cliquez sur Download, puis sur Run.
Autres outils pris en charge :
Avec des outils comme Ollama et LM Studio, vous pouvez exécuter des modèles comme Qwen 3, Gemma 3 et DeepSeek-R1 sur du matériel grand public - et Phi-4 est largement disponible sur d'autres plateformes, notamment Jan, GPT4All et Msty.
Meilleurs cas d'usage
- Mathématiques et raisonnement STEM - Phi-4 excelle dans la résolution de problèmes mathématiques, l'analyse de concepts scientifiques et le traitement de preuves logiques à plusieurs étapes.
- Génération et débogage de code - De solides performances sur les benchmarks de codage en font un idéal pour l'assistance au développement logiciel.
- Applications locales critiques en matière de confidentialité - Exécutez l'IA entièrement hors ligne sur votre propre matériel sans envoyer de données à des services cloud.
- Environnements à ressources limitées - Déployez sur des GPU grand public modestes (12 Go de VRAM) ou même des systèmes uniquement CPU.
- Outils éducatifs et de recherche - Analysez des documents, expliquez des concepts et générez des supports pédagogiques avec une grande qualité de raisonnement.
- Inférence économique à grande échelle - Après l'investissement matériel initial, aucun coût par token pour un usage à volume élevé.
Remarque : Phi-4 reste fondamentalement limité par sa taille pour certaines tâches, en particulier les hallucinations concernant des connaissances factuelles.
FAQ
Puis-je exécuter Phi-4 sur un ordinateur portable avec 8 Go de VRAM GPU ?
Oui, mais avec un déport vers le CPU. Phi-4 en Q4_K_M nécessite ~9 Go - environ 1 Go au-dessus de la limite d'une RTX 4060 8 Go. Ollama et llama.cpp gèrent le dépassement automatiquement en conservant certaines couches dans la RAM système. Le modèle s'exécute mais est environ 50 % plus lent que sur un GPU de 12 Go.
Quelle est la différence entre Phi-4 et Phi-4-mini ?
Phi-4 compte 14B paramètres tandis que Phi-4-mini en compte 3,8B, optimisé pour le raisonnement et les tâches à contexte de 128K. Phi-4-mini est plus efficace mais légèrement moins puissant, tandis que Phi-4 offre un raisonnement plus fort au prix de besoins en VRAM plus élevés.
Phi-4 est-il gratuit à utiliser commercialement ?
Oui. Phi-4 14B est publié sous MIT, une licence open source permissive qui autorise l'usage commercial, la modification et la redistribution.
Quelle est la vitesse de Phi-4 par rapport aux API cloud ?
Les tokens/sec estimés sont de l'ordre de 20 tokens/sec sur un GPU de milieu de gamme et jusqu'à 55 tokens/sec sur des cartes haut de gamme, en supposant que la quantification tienne entièrement dans la VRAM. La vitesse varie selon le matériel ; Ollama et LM Studio gèrent l'optimisation automatiquement.
Sources & crédits
Source originale: Microsoft Foundry Labs + Hugging Face