Reupload
Comprobar mi PC
Volver al inicio

IA local · Mistral AI, Hugging Face, ArXiv

Mistral y Mixtral: ejecutar LLM de peso abierto

Mistral y Mixtral: ejecutar LLM de peso abierto

Foto: Sandip Kalal en Unsplash

Mistral AI lanzó su primer modelo MoE abierto en diciembre de 2023, estableciendo una reputación de modelos de lenguaje eficientes que rinden por encima de su número de parámetros. Tanto Mixtral 8x7B contiene 46,7B parámetros totales pero realiza la inferencia a la misma velocidad y coste que modelos de un tercio de ese tamaño, y las variantes más nuevas siguen disponibles bajo la licencia Apache 2.0, lo que permite un despliegue de IA privado y personalizable en hardware de consumo.

¿Qué es Mistral / Mixtral?

Mistral Large 3 es uno de los mejores modelos de peso abierto permisivos del mundo y el primer modelo de mezcla de expertos de Mistral desde la seminal serie Mixtral. La familia Mistral abarca tanto modelos densos (7B, 24B, 128B) como variantes dispersas de Mezcla de Expertos. Mixtral 8x7B usa 8 redes de expertos de 7B parámetros cada una, con solo 2 expertos activándose por token, lo que significa que obtienes ~13B parámetros activos mientras te beneficias de 47B parámetros totales.

La familia de modelos Mixtral emplea una arquitectura dispersa de Mezcla de Expertos (SMoE) en la que un enrutador selecciona un subconjunto de redes de expertos para procesar cada token. Este diseño ofrece una eficiencia excepcional: Mixtral 8x7B ofrece una calidad más cercana a la de un modelo denso de 70B pero con el coste de inferencia de un modelo de 13B.

Tamaños y variantes disponibles

La línea de peso abierto Mistral / Mixtral incluye:

  • Mistral 7B: un modelo generativo de texto preentrenado con 7 mil millones de parámetros disponible en variantes base e instruct
  • Mixtral 8x7B: 46,7B parámetros totales que realizan inferencia a la misma velocidad y coste que modelos de un tercio de ese tamaño, con una longitud de contexto de 32k tokens
  • Mixtral 8x22B: mezcla dispersa de expertos con 39B parámetros activos de un total de 141B parámetros, con una ventana de contexto de 64K tokens
  • Mistral Small 3.1: 24 mil millones de parámetros con comprensión de visión de vanguardia y capacidades de contexto de 128k tokens
  • Mistral Large 3: modelo de Mezcla de Expertos granular multimodal de propósito general de vanguardia, con 41B parámetros activos y 675B parámetros totales

Todas las variantes de peso abierto se publican bajo la licencia Apache 2.0, lo que permite un uso investigador y comercial sin restricciones.

Requisitos de hardware

Las necesidades de VRAM varían significativamente según el tamaño del modelo y la cuantización:

  • Mistral 7B: 6-8 GB de VRAM con cuantización Q4 o Q5
  • Mixtral 8x7B: 24 GB de VRAM para cuantización Q4 (~28,4 GB de pesos con descarga parcial)
  • Mixtral 8x22B: 48 GB o más de VRAM para Q4 (~85,9 GB de pesos, ~97 GB en total)

Los modelos MoE deben mantener todos los expertos en VRAM aunque solo se activen unos pocos por token. Mixtral 8x7B en cuantización de 4 bits necesita aproximadamente 28 GB y cabe en una sola NVIDIA RTX 5090 de 32 GB.

En cuanto a las especificaciones a nivel de sistema: 16 GB de RAM como mínimo (se recomiendan 32 GB), cualquier CPU moderna de 8 núcleos y un SSD NVMe con 100-500 GB de espacio libre para los archivos del modelo. Mac (Apple Silicon) destaca gracias a la memoria unificada y el runtime MLX, Windows funciona mejor con NVIDIA + CUDA, y Linux ofrece la mayor flexibilidad de GPU, incluido el soporte para AMD ROCm.

Aspectos destacados de los benchmarks

Mixtral 8x7B superó a Llama 2 70B en nueve de doce benchmarks. Más concretamente, Mixtral supera significativamente a Llama 2 70B en francés, alemán, español e italiano.

Mixtral 8x7B alcanza ~70 % en MMLU, lo que es notablemente mejor que Mistral 7B. Mixtral puede manejar 32k tokens de contexto, muestra características sólidas en generación de código y, con 46,7 mil millones de parámetros totales pero usando solo 12,9 mil millones por token, mantiene tanto la velocidad como la eficiencia de coste.

Mistral 8x7B se sitúa en 43,1 en benchmarks recientes, por detrás de Mistral Large 3 (45,7) y Ministral 3 14B Reasoning (47,3). Para capacidades de frontera, Mistral Large 3 alcanza la paridad con los mejores modelos de peso abierto ajustados por instrucciones en prompts generales, a la vez que demuestra comprensión de imágenes y un rendimiento líder en su clase en conversaciones multilingües, debutando en el puesto n.º 2 en la categoría de modelos OSS no razonadores del ranking de LMArena.

Cómo ejecutarlo localmente

La ruta más sencilla es Ollama, un runtime centrado en la línea de comandos con un servidor en segundo plano ligero y una API compatible con OpenAI. Instálalo desde ollama.com y luego ejecuta:

ollama run mixtral:8x7b

Para la variante 8x22B usa: ollama run mixtral:8x22b. La biblioteca de Ollama incluye más de 200 modelos listos para ejecutar que abarcan Llama, Qwen, DeepSeek, Mistral, Gemma y la línea de peso abierto gpt-oss de OpenAI, cada uno preconfigurado con la plantilla de prompt adecuada.

Otras herramientas también admiten los modelos Mistral / Mixtral:

  • LM Studio: GUI de escritorio pulida dirigida a quienes prefieren navegar y hacer clic en lugar de escribir comandos, y que también ejecuta un servidor de API local
  • Jan: una de las aplicaciones de LLM locales más populares y con mejor aspecto, una alternativa centrada en la privacidad a ChatGPT
  • GPT4All: la más orientada a principiantes de las tres, con una lista de modelos curada y más pequeña y una experiencia de instalación en un clic más sencilla

Ollama está construido sobre llama.cpp, ofreciendo un excelente rendimiento de tokens por segundo con gestión inteligente de memoria y aceleración eficiente por GPU para GPU NVIDIA (CUDA), Apple Silicon (Metal) y AMD (ROCm).

Mejores casos de uso

Mixtral 8x7B es ideal para resumen de texto, preguntas y respuestas, clasificación de texto, compleción de texto y generación de código. Mistral 7B admite resumen de texto, clasificación, compleción de texto y compleción de código.

Tareas de código y técnicas: Mistral 7B se acerca al rendimiento de CodeLlama 7B en tareas de código a la vez que sigue siendo muy capaz en tareas de lengua inglesa. Mixtral 8x22B usa solo 39B parámetros activos de 141B y ofrece una eficiencia de coste inigualable, con fuertes capacidades matemáticas y de programación y llamada a funciones nativa.

Procesamiento de documentos y RAG: la ventana de contexto de 64K tokens de Mixtral 8x22B permite un recuerdo preciso de la información de documentos grandes, lo que lo hace excelente para la generación aumentada por recuperación y el resumen de documentos largos.

Flujos de trabajo multilingües: Mixtral 8x22B tiene capacidades multilingües nativas y supera ampliamente a LLaMA 2 70B en los benchmarks HellaSwag, Arc Challenge y MMLU en francés, alemán, español e italiano.

Inferencia en producción: Mixtral 8x7B es muy adecuado para entornos de producción que requieren modelos de peso abierto para personalización o ajuste fino cuando los recursos computacionales o la latencia son limitados.

Preguntas frecuentes

¿Puedo ejecutar Mixtral 8x7B en mi PC gaming?

Sí, con matices. Mixtral 8x7B en cuantización de 4 bits necesita aproximadamente 28 GB y cabe en una sola NVIDIA RTX 5090 de 32 GB. Tarjetas más antiguas como una RTX 3090 (24 GB) requieren técnicas de descarga de capas. Empieza con Mistral 7B si tienes 8 GB; se cuantiza a ~4,4 GB.

¿Qué es más rápido: el denso Mistral 7B o el disperso Mixtral 8x7B?

Mixtral 8x7B ofrece una calidad más cercana a la de un modelo denso de 70B pero con el coste de inferencia de un modelo de 13B porque solo se activan 2 de 8 expertos por token. Mistral 7B es más pequeño y carga más rápido, pero Mixtral ofrece mejor calidad a velocidad comparable gracias a su arquitectura dispersa.

¿Son seguros de usar comercialmente los modelos Mistral?

Sí. Tanto las versiones base como las ajustadas por instrucciones se publican bajo la licencia Apache 2.0, lo que proporciona una base sólida para una mayor personalización en las comunidades empresarial y de desarrolladores. No se aplican restricciones de licencia al uso investigador o de producción.

¿Cómo se compara Mixtral 8x22B con Mistral Large 3?

Mixtral 8x22B se retiró en marzo de 2025, y se recomienda Mistral Small 4 para nuevas integraciones. Mistral Large 3 es un modelo de mezcla de expertos multimodal de propósito general de vanguardia con 41B parámetros activos y 675B parámetros totales, que ofrece un rendimiento superior pero requiere 48 GB o más de VRAM. Para el despliegue local en hardware de consumo, Mixtral 8x7B o Mistral Small 3.1 siguen siendo el punto óptimo práctico.

¿Quieres saber si tu ordenador puede ejecutar IA local?

Fuentes y créditos

Fuente original: Mistral AI, Hugging Face, ArXiv