Reupload
Tester mon PC
Retour à l'accueil

IA locale · Meta Llama Official Blog & Hugging Face Model Cards

Llama 3.2 : modèles vision ouverts et modèles légers

Llama 3.2 : modèles vision ouverts et modèles légers

Photo: Milad Fakurian sur Unsplash

Llama 3.2 est une suite de modèles comprenant des modèles texte légers de 1 et 3 milliards de paramètres, aux côtés de modèles vision-langage de 11 et 90 milliards de paramètres. Ces modèles vont de modèles texte adaptés aux appareils en périphérie à des variantes multimodales capables de tâches de raisonnement sophistiquées. Optimisé à la fois pour le déploiement local et l'inférence dans le cloud, Llama 3.2 incarne la volonté de Meta de démocratiser l'IA à tous les niveaux d'appareils.

Qu'est-ce que Llama 3.2 ?

Llama 3.2 est une famille de modèles de langage révolutionnaire qui offre des capacités améliorées, une applicabilité plus large et un support multimodal des images. Cette version inclut des LLM à vision de petite et moyenne taille (11B et 90B), ainsi que des modèles légers, uniquement textuels (1B et 3B), qui tiennent sur des appareils en périphérie et mobiles, en versions pré-entraînées et ajustées aux instructions.

Les modèles 11B et 90B sont les premiers modèles Llama à prendre en charge les tâches de vision, grâce à une nouvelle architecture de modèle qui intègre les représentations de l'encodeur d'images dans le modèle de langage. Les modèles 1B et 3B sont pris en charge dès le premier jour sur le matériel Qualcomm et MediaTek, et optimisés pour les processeurs Arm.

Tailles et variantes disponibles

La collection Llama 3.2 propose des modèles de différentes tailles, des modèles texte légers de 1 et 3 milliards de paramètres adaptés aux appareils en périphérie, jusqu'aux modèles de petite et moyenne taille de 11 et 90 milliards de paramètres capables de tâches de raisonnement sophistiquées, y compris le support multimodal pour les images haute résolution.

Modèles texte uniquement (pré-entraînés et ajustés aux instructions) :

  • Llama 3.2 1B comprend 1,23 milliard de paramètres ; le 3B comprend 3,21 milliards de paramètres
  • Les deux sont disponibles en BF16 et en variantes quantifiées (INT4/INT8)
  • Les versions instruct quantifiées ont une longueur de contexte réduite à 8k

Modèles vision-langage (multimodaux) :

  • Variantes vision 11B et 90B pour la compréhension d'images et la génération de texte
  • Le modèle de base 11B prend en charge des tailles de tuiles de 448, tandis que la version instruct et les modèles 90B utilisent des tailles de tuiles de 560

Configuration matérielle requise

Pour l'inférence (modèles texte 1B/3B uniquement) :

  • Le modèle 3B nécessite environ 7 Go de VRAM pour une inférence en FP16
  • Quantifié en INT4, le modèle 3B nécessite environ 1,8 Go de VRAM, il tient donc sur une RTX 4090 de 24 Go avec de la place pour un petit lot
  • Recommandé : GPU compatible CUDA (16 Go de VRAM ou plus) ; RAM : au moins 32 Go (64 Go pour les modèles plus grands)
  • Minimum 50 Go d'espace disque libre pour le modèle et ses dépendances

Pour les modèles vision (11B/90B) :

  • Les modèles vision nécessitent nettement plus de ressources ; la quantification (INT4/QLoRA) est recommandée pour un déploiement local

CPU/Système :

  • Système d'exploitation : Linux (préféré), macOS ou Windows ; Python : version 3.8 ou supérieure ; CUDA Toolkit : requis pour l'accélération GPU (11.6 ou plus récent)

Points forts des benchmarks

Dans le test MMLU avec une invite en chaîne de pensée, Llama 3.2 90B obtient 86,0, dépassant légèrement Claude 3 Haiku et proche de GPT-4o-mini.

Sur MMLU (5-shot), Llama 3.2 3B obtient 63,4, dépassant Gemma 2B IT à 57,8. Sur GPQA (0-shot, CoT), Llama 3.2 90B obtient 46,7, mieux que Claude 3 Haiku mais derrière GPT-4o-mini.

Dans le test IFEval, Llama 3.2 3B obtient un impressionnant 77,4, battant Gemma 2B IT (61,9) et Phi-3.5-mini IT (59,2). Sur le benchmark multilingue MGSM, Llama 3.2 90B obtient 86,9, un résultat solide comparable à celui de GPT-4o-mini à 87,0.

Comment l'exécuter localement

Avec Ollama (méthode la plus rapide) :

Pour le modèle 3B le plus populaire :

ollama run llama3.2:3b

Pour le modèle 1B (encore plus léger) :

ollama run llama3.2:1b

Exécuteurs locaux alternatifs :

  • LM Studio - propose une interface graphique avec recherche et gestion intégrées des modèles
  • Jan - interface épurée optimisée pour un usage conversationnel
  • GPT4All - application de bureau avec téléchargement des modèles en un clic
  • Msty - client complet avec modèles d'invites et gestion de l'historique

Toutes ces applications incluent Llama 3.2 dans leurs catalogues de modèles par défaut et gèrent automatiquement les variantes quantifiées.

Installation manuelle (avancée) :

Les modèles ont été entraînés avec jusqu'à 9 billions de tokens et prennent en charge une longueur de contexte de 128k tokens. Téléchargez les poids BF16 ou quantifiés depuis Hugging Face (meta-llama/Llama-3.2-1B, meta-llama/Llama-3.2-3B, etc.) et utilisez transformers + torch, ou des frameworks spécialisés comme vLLM pour un service optimisé.

Meilleurs cas d'usage

Modèles texte uniquement (1B/3B) :

  • Cas d'usage embarqués comme le résumé, le suivi d'instructions et les tâches de réécriture exécutés localement en périphérie
  • Réécriture d'invites, récupération de connaissances multilingues, tâches de résumé, utilisation d'outils et assistants fonctionnant localement
  • Assistants de rédaction mobiles propulsés par l'IA
  • Systèmes personnels de gestion des connaissances
  • Traitement en temps réel sur téléphones, tablettes et appareils intelligents

Modèles vision (11B/90B) :

  • Tâches de raisonnement visuel et de compréhension d'images, surpassant des modèles fermés comme Claude 3 Haiku
  • Analyse de documents (graphiques, diagrammes, rapports financiers)
  • Légendage d'images et ancrage visuel
  • Compréhension et recherche de documents multimodaux

FAQ

Puis-je utiliser Llama 3.2 à des fins commerciales ?

Llama 3.2 est accordé sous une licence limitée non exclusive, mondiale, non transférable et sans redevance, autorisant l'utilisation, la reproduction, la distribution, la copie, la création d'œuvres dérivées et les modifications. Si les utilisateurs actifs mensuels dépassent 700 millions, un accord commercial distinct avec Meta est requis, ce qui peut impliquer des frais ou des redevances d'usage.

Quelle est la longueur de contexte prise en charge ?

Tous les modèles Llama 3.2 prennent en charge une longueur de contexte de 128K, conservant la capacité de tokens étendue introduite dans Llama 3.1. Notez que les versions instruct quantifiées ont une longueur de contexte réduite à 8k.

Quelle taille de modèle choisir pour mon appareil ?

Pour l'inférence sur des GPU grand public comme une RTX 4090, le modèle 3B nécessite 7 Go en FP16 mais seulement 1,8 Go lorsqu'il est quantifié en INT4. Choisissez le 1B pour une portabilité maximale sur téléphones/périphérie ; choisissez le 3B pour une meilleure qualité lorsque vous disposez de 2 Go ou plus. Pour un ordinateur de bureau avec 8 Go de VRAM ou plus, utilisez le 3B en pleine précision ou le modèle vision 11B quantifié.

Les modèles multimodaux sont-ils restreints ?

En ce qui concerne les modèles multimodaux, les droits accordés par le contrat de licence communautaire Llama 3.2 ne sont pas accordés si vous êtes un particulier domicilié dans l'Union européenne, ou une entreprise dont le principal établissement se trouve dans l'Union européenne. Cette restriction ne s'applique pas aux utilisateurs finaux d'un produit ou service intégrant ces modèles multimodaux.

Envie de savoir si votre ordinateur peut faire tourner une IA en local ?

Sources & crédits

Source originale: Meta Llama Official Blog & Hugging Face Model Cards