Reupload
Comprobar mi PC
Volver al inicio

IA local · Meta Llama Official Blog & Hugging Face Model Cards

Llama 3.2: Modelos de peso abierto con visión y modelos ligeros

Llama 3.2: Modelos de peso abierto con visión y modelos ligeros

Foto: Milad Fakurian en Unsplash

Llama 3.2 es una suite de modelos que incluye modelos ligeros solo de texto de 1B y 3B parámetros, junto con modelos de visión-lenguaje de 11B y 90B parámetros. Estos abarcan desde modelos de solo texto aptos para dispositivos de borde hasta variantes multimodales capaces de tareas de razonamiento sofisticadas. Optimizada tanto para el despliegue local como para la inferencia en la nube, Llama 3.2 representa el impulso de Meta hacia la democratización de la IA en todos los niveles de dispositivos.

¿Qué es Llama 3.2?

Llama 3.2 es una revolucionaria familia de modelos de lenguaje con capacidades mejoradas, mayor aplicabilidad y soporte multimodal de imágenes. Esta versión incluye LLM de visión pequeños y medianos (11B y 90B), y modelos ligeros solo de texto (1B y 3B) que caben en dispositivos de borde y móviles, tanto en versiones preentrenadas como ajustadas por instrucciones.

Los modelos de 11B y 90B son los primeros modelos Llama en admitir tareas de visión, con una nueva arquitectura de modelo que integra representaciones del codificador de imágenes en el modelo de lenguaje. Los modelos de 1B y 3B están habilitados desde el primer día para hardware de Qualcomm y MediaTek y optimizados para procesadores Arm.

Tamaños y variantes disponibles

La colección Llama 3.2 ofrece modelos de varios tamaños, desde modelos ligeros solo de texto de 1B y 3B parámetros adecuados para dispositivos de borde hasta modelos pequeños y medianos de 11B y 90B parámetros capaces de tareas de razonamiento sofisticadas, incluido el soporte multimodal para imágenes de alta resolución.

Modelos solo de texto (preentrenados y ajustados por instrucciones):

  • Llama 3.2 1B comprende 1,23B parámetros; el 3B comprende 3,21B parámetros
  • Ambos disponibles en BF16 y variantes cuantizadas (INT4/INT8)
  • Las versiones instruct cuantizadas tienen una longitud de contexto reducida de 8k

Modelos de visión-lenguaje (multimodales):

  • Variantes de visión de 11B y 90B para comprensión de imágenes y generación de texto
  • El modelo base de 11B admite tamaños de mosaico de 448, mientras que la versión instruct y los modelos de 90B usan tamaños de mosaico de 560

Requisitos de hardware

Para inferencia (modelos solo de texto 1B/3B):

  • El modelo de 3B necesita unos 7 GB de VRAM para inferencia en FP16
  • Cuantizado a INT4, el modelo de 3B necesita unos 1,8 GB de VRAM, por lo que cabe en una RTX 4090 de 24 GB con espacio para un lote pequeño
  • Recomendado: GPU con soporte CUDA (16 GB de VRAM o más); RAM: al menos 32 GB (64 GB para modelos más grandes)
  • Mínimo 50 GB de espacio libre en disco para el modelo y las dependencias

Para modelos de visión (11B/90B):

  • Los modelos de visión requieren bastantes más recursos; se recomienda la cuantización (INT4/QLoRA) para el despliegue local

CPU/Sistema:

  • Sistema operativo: Linux (preferido), macOS o Windows; Python: versión 3.8 o superior; CUDA Toolkit: necesario para la aceleración por GPU (11.6 o más reciente)

Aspectos destacados de los benchmarks

En la prueba MMLU con prompting de cadena de pensamiento, Llama 3.2 90B obtiene 86,0, superando ligeramente a Claude 3 Haiku y cerca de GPT-4o-mini.

En MMLU (5-shot), Llama 3.2 3B obtiene 63,4, superando a Gemma 2B IT con 57,8. En GPQA (0-shot, CoT), Llama 3.2 90B obtiene 46,7, mejor que Claude 3 Haiku pero por detrás de GPT-4o-mini.

En la prueba IFEval, Llama 3.2 3B obtiene un impresionante 77,4, superando a Gemma 2B IT (61,9) y Phi-3.5-mini IT (59,2). En el benchmark multilingüe MGSM, Llama 3.2 90B obtiene 86,9, un resultado sólido comparable a GPT-4o-mini con 87,0.

Cómo ejecutarlo localmente

Usando Ollama (el método más rápido):

Para el modelo de 3B más popular:

ollama run llama3.2:3b

Para el modelo de 1B (aún más ligero):

ollama run llama3.2:1b

Runners locales alternativos:

  • LM Studio: ofrece una interfaz gráfica con búsqueda y gestión de modelos integradas
  • Jan: interfaz simplificada optimizada para el uso conversacional
  • GPT4All: aplicación de escritorio con descargas de modelos en un clic
  • Msty: cliente con todas las funciones, con plantillas de prompts y gestión de historial

Todas estas aplicaciones incluyen Llama 3.2 en sus catálogos de modelos predeterminados y gestionan las variantes de cuantización automáticamente.

Configuración manual (avanzada):

Los modelos se entrenaron con hasta 9 billones de tokens y admiten una longitud de contexto larga de 128k tokens. Descarga los pesos en BF16 o cuantizados desde Hugging Face (meta-llama/Llama-3.2-1B, meta-llama/Llama-3.2-3B, etc.) y usa transformers + torch, o frameworks especializados como vLLM para un servicio optimizado.

Mejores casos de uso

Modelos solo de texto (1B/3B):

  • Casos de uso en el dispositivo, como resumen, seguimiento de instrucciones y tareas de reescritura que se ejecutan localmente en el borde
  • Reescritura de prompts, recuperación de conocimiento multilingüe, tareas de resumen, uso de herramientas y asistentes que se ejecutan localmente
  • Asistentes de escritura impulsados por IA en móviles
  • Sistemas personales de gestión del conocimiento
  • Procesamiento en tiempo real en teléfonos, tabletas y dispositivos inteligentes

Modelos de visión (11B/90B):

  • Tareas de razonamiento visual y comprensión de imágenes, superando a modelos cerrados como Claude 3 Haiku
  • Análisis de documentos (gráficos, diagramas, informes financieros)
  • Descripción de imágenes y anclaje visual
  • Comprensión y búsqueda de documentos multimodales

Preguntas frecuentes

¿Puedo usar Llama 3.2 comercialmente?

Llama 3.2 se concede bajo una licencia limitada no exclusiva, mundial, no transferible y libre de regalías que permite el uso, la reproducción, la distribución, la copia, la creación de obras derivadas y las modificaciones. Si los usuarios activos mensuales superan los 700 millones, se requiere un acuerdo comercial aparte con Meta, que puede implicar tarifas o regalías basadas en el uso.

¿Qué longitud de contexto admite?

Todos los modelos Llama 3.2 admiten una longitud de contexto de 128K, manteniendo la capacidad de tokens ampliada introducida en Llama 3.1. Ten en cuenta que las versiones instruct cuantizadas tienen una longitud de contexto reducida de 8k.

¿Qué tamaño de modelo debo elegir para mi dispositivo?

Para inferencia en GPU de consumo como una RTX 4090, el modelo de 3B necesita 7 GB en FP16 pero solo 1,8 GB cuando se cuantiza a INT4. Elige el 1B para máxima portabilidad en teléfonos/borde; elige el 3B para mejor calidad cuando tengas 2 GB o más disponibles. Para un escritorio con 8 GB o más de VRAM, usa el 3B a precisión completa o el modelo de visión de 11B cuantizado.

¿Están restringidos los modelos multimodales?

Con respecto a los modelos multimodales, los derechos concedidos bajo el Acuerdo de Licencia Comunitaria de Llama 3.2 no se conceden si eres una persona física domiciliada en la Unión Europea, o una empresa con sede principal en la Unión Europea. Esta restricción no se aplica a los usuarios finales de un producto o servicio que incorpore estos modelos multimodales.

¿Quieres saber si tu ordenador puede ejecutar IA local?

Fuentes y créditos

Fuente original: Meta Llama Official Blog & Hugging Face Model Cards