Reupload
Comprobar mi PC
Volver al inicio

IA local · Google AI Developers Blog & Official Documentation

Gemma 2: Guía completa del modelo de peso abierto

Gemma 2: Guía completa del modelo de peso abierto

Foto: Growtika en Unsplash

Gemma 2 es la familia de grandes modelos de lenguaje de descarga gratuita de Google, disponible en tamaños de 2B, 9B y 27B parámetros. Destilados de Gemini y entrenados con destilación de conocimiento, estos modelos ofrecen un rendimiento competitivo con modelos muchas veces su tamaño a la vez que se ejecutan de forma eficiente en hardware de consumo. Disponibles bajo una licencia permisiva y compatibles con Ollama, LM Studio y otras herramientas de inferencia local.

¿Qué es Gemma 2?

Gemma 2 es la familia de grandes modelos de lenguaje abiertos de Google, que ofrece tamaños de 2B, 9B y 27B parámetros. Estos modelos abiertos ligeros y de vanguardia ofrecen el mejor rendimiento para su tamaño, e incluso ofrecen alternativas competitivas a modelos 2-3 veces más grandes.

Gemma 2 2B es un modelo de lenguaje compacto de pesos abiertos desarrollado por Google para despliegues en el borde y móviles con recursos limitados, destilado de arquitecturas Gemini más grandes. Gemma 2 está disponible bajo una licencia Gemma favorable al uso comercial, que da a desarrolladores e investigadores la capacidad de compartir y comercializar sus innovaciones.

Tamaños y variantes disponibles

Gemma 2 está disponible en tamaños de 2B, 9B y 27B parámetros. Cada tamaño viene en dos variantes:

  • Modelo base: preentrenado, adecuado para ajuste fino e investigación
  • Ajustado por instrucciones (IT): optimizado para tareas conversacionales e interacciones con el usuario

Especificaciones técnicas

  • Longitud de contexto: todos los modelos admiten una longitud de secuencia de 8.192 tokens.
  • Tamaño del vocabulario: 256.128 tokens (significativamente mayor que los modelos competidores)
  • Arquitectura: transformer denso con diseño solo decodificador
  • Datos de entrenamiento: el corpus de entrenamiento del modelo de 9B consistió en 8 billones de tokens, principalmente de documentos web, código y contenido matemático.

Requisitos de hardware

Requisitos de memoria (precisión completa FP16)

Gemma 2 2B: 5,76 GB de VRAM a 1K tokens, 6,16 GB de VRAM a 8K tokens. Una sola RTX 4090 o equivalente lo maneja cómodamente.

Gemma 2 9B: Normalmente requiere 18-20 GB de VRAM para precisión completa. GPU como NVIDIA A100 40 GB o RTX 4090 con 24 GB de VRAM pueden ajustar finamente Gemma 2 2B con tamaños de lote reducidos.

Gemma 2 27B: A precisión completa (FP16) con 8.192 tokens, requiere 61,44 GB de VRAM, adecuado para 1x NVIDIA A100 80 GB, 3x RTX 4090 24 GB o 1x Apple M3 Max 128 GB.

Opciones de cuantización

  • Cuantización INT8: reduce la memoria a la mitad (aproximadamente)
  • Cuantización INT4: reduce aún más a 1/4 del tamaño original, permite la inferencia en portátil
  • Formato GGUF: optimizado para la inferencia basada en CPU con Ollama y herramientas similares

Gemma 2B en cuantización Q4 (aproximadamente 1,4 GB) puede ejecutarse en una Raspberry Pi 4 con 4 GB de RAM, ofreciendo aproximadamente 3-5 tokens por segundo.

Aspectos destacados de los benchmarks

Los modelos Gemma 2 demuestran un rendimiento excepcional en relación con su número de parámetros en múltiples marcos de evaluación.

LMSYS Chatbot Arena (evaluación humana)

Gemma 27B (Elo 1218) se clasificó por encima de Llama 3 70B (Elo 1206), Gemma 9B (Elo 1187) similar a GPT-4-0314 (Elo 1186), Gemma 2.6B (Elo 1126) se clasificó por encima de GPT-3.5-Turbo-0613 (Elo 1116).

Benchmarks académicos

En el benchmark MMLU, Gemma 2 2B obtiene un 52,2 %, Gemma 2 9B un 71,3 % y Gemma 2 27B un 75,2 %. Puntuaciones adicionales:

  • GSM8K (matemáticas): Gemma 2 9B: 68,6 %, Gemma 2 27B: 74,0 %
  • HumanEval (código): Gemma 2 9B: 68,2 %, Gemma 2 27B: 74,9 %
  • BBH (razonamiento): Gemma 2 9B: 68,2 %, Gemma 2 27B: 74,9 %

Logro clave

El modelo de 27B ascendió rápidamente en el ranking de LMSYS Chatbot Arena, superando incluso a modelos populares de más del doble de su tamaño en conversaciones atractivas del mundo real, mientras que el modelo Gemma 2 2B supera a todos los modelos GPT-3.5 en el Chatbot Arena con un tamaño ejecutable en dispositivos de borde.

Cómo ejecutarlo localmente

Usando Ollama (método más fácil)

Gemma 2 es compatible con los principales frameworks de IA, incluidos Hugging Face Transformers, JAX, PyTorch, TensorFlow a través de Keras 3.0, vLLM, Gemma.cpp, Llama.cpp y Ollama.

Instalación y uso:

  1. Instala Ollama desde ollama.com
  2. Ejecuta uno de estos comandos:
  • 2B parámetros: ollama run gemma2:2b
  • 9B parámetros: ollama run gemma2
  • 27B parámetros: ollama run gemma2:27b

Herramientas alternativas

Otras plataformas populares de inferencia local también admiten Gemma 2:

  • LM Studio: descárgalo desde lmstudio.ai, proporciona una GUI para la gestión de modelos
  • Jan: alternativa de código abierto con funcionalidad similar
  • GPT4All: interfaz para principiantes con modelos preconfigurados
  • Msty: aplicación de escritorio multiplataforma para inferencia local de LLM

Todas estas herramientas te permiten descargar versiones cuantizadas de Gemma 2 desde sus catálogos de modelos integrados y ejecutarlas sin conexión.

Mejores casos de uso

Gemma 2 9B es adecuado para la creación de contenido, como poesía, redacción publicitaria y generación de código, y las variantes ajustadas por instrucciones son especialmente eficaces para agentes conversacionales y chatbots, con soporte para tareas como preguntas y respuestas y resumen.

Aplicaciones ideales:

  • Dispositivos de borde y móviles: el modelo de 2B se ejecuta de forma eficiente en teléfonos y sistemas embebidos
  • Generación y asistencia de código: sólido rendimiento en HumanEval y benchmarks de programación
  • Resumen de documentos: resumen abstractivo y extractivo de alta calidad
  • Chatbots de atención al cliente: las variantes ajustadas por instrucciones sobresalen en el diálogo orientado al usuario
  • Despliegues locales centrados en la privacidad: control total de los datos sin llamadas a API externas
  • Herramientas educativas: sistemas de preguntas y respuestas profesor/alumno y aplicaciones de tutoría
  • Inferencia rentable: el despliegue en una sola GPU o CPU reduce los costes operativos

Preguntas frecuentes

¿Puede Gemma 2 ejecutarse totalmente en mi portátil sin GPU?

El tamaño relativamente pequeño de Gemma 2 hace posible desplegarlos en entornos con recursos limitados, como un portátil, un escritorio o tu propia infraestructura en la nube. El modelo de 2B puede ejecutarse en CPU, aunque las velocidades serán lentas (unos pocos tokens por segundo). La cuantización al formato INT4 reduce aún más los requisitos de memoria.

¿Cuál es la diferencia entre los modelos base y ajustados por instrucciones de Gemma 2?

Los modelos base están preentrenados y optimizados para el ajuste fino en tareas personalizadas. Las variantes ajustadas por instrucciones (IT) reciben entrenamiento adicional para seguir las instrucciones del usuario y entablar diálogo, lo que las hace listas para usar de inmediato como chatbots sin entrenamiento adicional.

¿Gemma 2 es realmente de código abierto?

Los modelos Gemma son de "peso abierto" en lugar de totalmente de código abierto: los pesos están disponibles gratuitamente, pero los datos de entrenamiento y el código no. La licencia permisiva sigue permitiendo el uso comercial y la redistribución de los pesos del modelo.

¿Cómo se compara Gemma 2 con Llama 3?

El modelo Gemma 2 de 9B ofrece un rendimiento líder en su clase, superando a Llama 3 8B y otros modelos abiertos de su categoría de tamaño. La variante de 27B logra un rendimiento competitivo con modelos Llama 3 mucho más grandes a pesar de ser más pequeña.

¿Quieres saber si tu ordenador puede ejecutar IA local?

Fuentes y créditos

Fuente original: Google AI Developers Blog & Official Documentation