Reupload
Comprobar mi PC
Volver al inicio

IA local · Microsoft Foundry Labs + Hugging Face

Phi-4: el potente modelo de razonamiento de 14B de Microsoft

Phi-4: el potente modelo de razonamiento de 14B de Microsoft

Foto: Shubham Dhage en Unsplash

Phi-4 es el modelo de lenguaje pequeño de 14 mil millones de parámetros de Microsoft, entrenado con 9,8 billones de tokens de datos sintéticos y orgánicos curados, que logra un rendimiento excepcional en benchmarks de razonamiento y matemáticas. Disponible en varios tamaños (14B, 3,8B mini, 5,6B multimodal), se ejecuta localmente en hardware de consumo mediante Ollama, LM Studio y otras herramientas, con una licencia MIT que permite el uso comercial.

¿Qué es Phi-4?

Phi-4 es el modelo de lenguaje pequeño de 14 mil millones de parámetros de Microsoft, entrenado con aproximadamente 9,8 billones de tokens de datos sintéticos de "estilo libro de texto" combinados con documentos públicos filtrados y material académico curado. El modelo se alinea mediante ajuste fino supervisado y optimización directa de preferencias, con una ventana de contexto de 16K tokens.

Phi-4 se publica bajo una licencia MIT, lo que lo hace libremente utilizable para fines comerciales y de investigación. El modelo está diseñado para el razonamiento, las matemáticas y la generación de código en entornos con memoria limitada, logrando un 84,8 % en MMLU, un 80,4 % en MATH y un 82,6 % en HumanEval.

Tamaños y variantes disponibles

La familia Phi-4 incluye tres modelos principales:

  • Phi-4 (14B): el modelo insignia optimizado para razonamiento complejo y resolución de problemas matemáticos, con una ventana de contexto de 16K tokens.
  • Phi-4-mini (3,8B): optimizado para razonamiento y tareas con contexto de 128K. Este modelo cuenta con un vocabulario de 200.000 palabras que permite un mayor soporte multilingüe, atención de consultas agrupadas, llamada a funciones integrada, mejor seguimiento de instrucciones y embedding compartido.
  • Phi-4-multimodal (5,6B): unifica voz, visión y texto en una sola arquitectura. Admite texto, audio e imagen como entrada, y devuelve texto como salida.

Además, Microsoft ha publicado variantes de razonamiento especializadas optimizadas para tareas matemáticas y lógicas avanzadas.

Requisitos de hardware

Inferencia basada en GPU (recomendada):

  • Phi-4 (14B) en Q4_K_M requiere aproximadamente 9 GB de VRAM. En Q8 necesita aproximadamente 14 GB. En FP16 necesita aproximadamente 28 GB.
  • Phi-4-mini (3,8B) en Q4_K_M requiere solo unos 2,5 GB: cabe en cualquier GPU o se ejecuta solo con CPU.
  • Recomendado: 12 GB de VRAM (RTX 4070, RTX 3060 12 GB) ejecutando Q5_K_M para la mejor relación calidad-rendimiento.

Inferencia solo con CPU:

  • Mínimo: 16 GB de RAM del sistema para inferencia solo con CPU.
  • Se espera una fracción de la velocidad de la GPU, lo cual está bien para trabajos en segundo plano o por lotes, pero es lento para el chat interactivo.

RAM del sistema:

  • Windows 10/11, 16 GB de RAM como mínimo (se recomiendan 32 GB).

Aspectos destacados de los benchmarks

Phi-4 logra un 84,8 % en MMLU, un 80,4 % en MATH y un 82,6 % en HumanEval. De 13 benchmarks, Phi-4 supera a Llama 3.3 70B (su competidor de peso abierto más reciente) en seis, y a Qwen 2.5 en cinco.

Phi-4 supera a Llama 3.3 70B, Qwen 2.5 y GPT-4o en GPQA (preguntas y respuestas de nivel de posgrado) y MATH (problemas matemáticos de nivel de competición). En GPQA (preguntas STEM de nivel de posgrado) y MATH (competiciones matemáticas), incluso supera a su modelo maestro, GPT-40. También obtiene una puntuación más alta en programación, medida por HumanEval y HumanEval+, que cualquier otro modelo de peso abierto.

Phi-4 tiene un corte de conocimiento de junio de 2024. Los datos de entrenamiento del modelo incluyen información hasta esta fecha.

Cómo ejecutarlo localmente

Usando Ollama (recomendado, lo más fácil):

Abre tu terminal y ejecuta el comando ollama run phi4. Este comando realiza dos acciones: descarga los pesos del modelo desde la biblioteca de Ollama e inicia inmediatamente una sesión de chat interactiva.

Para Phi-4-mini, usa: ollama run phi4-mini

Ollama gestiona la detección de GPU automáticamente en Windows. La GPU se detecta automáticamente en NVIDIA, AMD (ROCm) y Apple Silicon. Ollama usa Q4_K_M de forma predeterminada. En una GPU de 8 GB, descargará automáticamente las capas de desbordamiento a la RAM de la CPU.

Usando LM Studio (basado en GUI):

LM Studio 0.4.12 es totalmente compatible con Phi-4 y Phi-4-mini en Windows 10 y 11. Proporciona una interfaz de chat, comparación de modelos y un modo de servidor local con GUI, sin necesidad de línea de comandos. Simplemente busca "Phi-4" en la pestaña Discover, haz clic en Download y luego en Run.

Otras herramientas compatibles:

Con herramientas como Ollama y LM Studio, puedes ejecutar modelos como Qwen 3, Gemma 3 y DeepSeek-R1 en hardware de consumo, y Phi-4 está ampliamente disponible en otras plataformas, incluidas Jan, GPT4All y Msty.

Mejores casos de uso

  • Razonamiento matemático y STEM: Phi-4 sobresale en la resolución de problemas matemáticos, el análisis de conceptos científicos y la elaboración de pruebas lógicas de varios pasos.
  • Generación y depuración de código: su sólido rendimiento en benchmarks de programación lo hace ideal para la asistencia al desarrollo de software.
  • Aplicaciones locales críticas para la privacidad: ejecuta la IA totalmente sin conexión en tu propio hardware sin enviar datos a servicios en la nube.
  • Entornos con recursos limitados: despliégalo en GPU de consumo modestas (12 GB de VRAM) o incluso en sistemas solo con CPU.
  • Herramientas educativas y de investigación: analiza documentos, explica conceptos y genera materiales de aprendizaje con alta calidad de razonamiento.
  • Inferencia rentable a escala: tras la inversión inicial en hardware, coste cero por token para un uso de gran volumen.

Nota: Phi-4 sigue estando fundamentalmente limitado por su tamaño para ciertas tareas, concretamente en las alucinaciones en torno al conocimiento factual.

Preguntas frecuentes

¿Puedo ejecutar Phi-4 en un portátil con 8 GB de VRAM de GPU?

Sí, pero con descarga a CPU. Phi-4 en Q4_K_M requiere ~9 GB, aproximadamente 1 GB por encima del límite de una RTX 4060 de 8 GB. Ollama y llama.cpp gestionan el desbordamiento automáticamente manteniendo algunas capas en la RAM del sistema. El modelo se ejecuta pero es un ~50 % más lento que en una GPU de 12 GB.

¿Cuál es la diferencia entre Phi-4 y Phi-4-mini?

Phi-4 tiene 14B parámetros mientras que Phi-4-mini tiene 3,8B parámetros, optimizado para razonamiento y tareas con contexto de 128K. Phi-4-mini es más eficiente pero ligeramente menos potente, mientras que Phi-4 ofrece un razonamiento más fuerte a costa de mayores requisitos de VRAM.

¿Phi-4 es gratuito para uso comercial?

Sí. Phi-4 14B se publica bajo MIT, una licencia de código abierto permisiva que permite el uso comercial, la modificación y la redistribución.

¿Qué tan rápido es Phi-4 en comparación con las API en la nube?

Los tokens/seg estimados son del orden de 20 tokens/seg en una GPU de gama media y de hasta 55 tokens/seg en tarjetas de gama alta, suponiendo que la cuantización quepa completamente en la VRAM. La velocidad varía según el hardware; Ollama y LM Studio gestionan la optimización automáticamente.

¿Quieres saber si tu ordenador puede ejecutar IA local?

Fuentes y créditos

Fuente original: Microsoft Foundry Labs + Hugging Face