Reupload
PCチェック
ホームに戻る

ローカルAI · Microsoft Foundry Labs + Hugging Face

Phi-4:Microsoftの強力な14B推論モデル

Phi-4:Microsoftの強力な14B推論モデル

写真: Shubham Dhage Unsplashより

Phi-4は、厳選された合成データと有機的データの9.8兆トークンで学習されたMicrosoftの140億パラメータの小型言語モデルで、推論と数学のベンチマークで卓越した性能を達成している。複数のサイズ(14B、3.8B mini、5.6Bマルチモーダル)で利用可能で、Ollama、LM Studio、その他のツールを通じてコンシューマーハードウェア上でローカルに動作し、MITライセンスにより商用利用が可能である。

Phi-4とは何か

Phi-4は、合成の「教科書風」データ約9.8兆トークンと、フィルタリングされた公開文書および厳選された学術資料を組み合わせて学習された、Microsoftの140億パラメータの小型言語モデルである。このモデルは教師ありファインチューニングと直接選好最適化(direct preference optimization)を用いて調整され、16Kトークンのコンテキストウィンドウを持つ。

Phi-4はMITライセンスの下でリリースされ、商用利用と研究利用のために自由に使用できる。このモデルは、メモリが制約された環境での推論、数学、コード生成のために設計され、MMLUで84.8%、MATHで80.4%、HumanEvalで82.6%を達成している。

利用可能なサイズと変種

Phi-4ファミリーには3つの主要なモデルが含まれる:

  • Phi-4(14B) - 複雑な推論と数学的問題解決に最適化されたフラッグシップモデルで、16Kトークンのコンテキストウィンドウを持つ。
  • Phi-4-mini(3.8B) - 推論と128Kコンテキストタスクに最適化されている。このモデルは20万語の語彙を持ち、多言語サポートの拡大、グループ化クエリアテンション(grouped-query attention)、組み込みの関数呼び出し、改善された指示追従、共有埋め込みを特徴とする。
  • Phi-4-multimodal(5.6B) - 音声、視覚、テキストを単一のアーキテクチャに統合する。テキスト、音声、画像を入力としてサポートし、出力としてテキストを返す。

さらに、Microsoftは高度な数学および論理タスクに最適化された専門的な推論変種もリリースしている。

ハードウェア要件

GPUベースの推論(推奨):

  • Phi-4(14B)はQ4_K_Mで約9GBのVRAMを必要とする。Q8では約14GB、FP16では約28GBを必要とする。
  • Phi-4-mini(3.8B)はQ4_K_Mでわずか約2.5GBを必要とし、どのGPUにも収まるか、CPUのみで動作する。
  • 推奨:12GBのVRAM(RTX 4070、RTX 3060 12GB)でQ5_K_Mを実行すると、品質と性能の最良の比率が得られる。

CPUのみの推論:

  • 最低:CPUのみの推論には16GBのシステムRAMが必要。
  • GPU速度の何分の一かになることを想定されたい。これはバックグラウンドジョブやバッチジョブには問題ないが、対話型チャットには遅い。

システムRAM:

  • Windows 10/11、最低16GBのRAM(32GB推奨)。

ベンチマークのハイライト

Phi-4はMMLUで84.8%、MATHで80.4%、HumanEvalで82.6%を達成している。13のベンチマークのうち、Phi-4はLlama 3.3 70B(最も新しいオープンウェイトの競合)を6つで、Qwen 2.5を5つで上回っている。

Phi-4はGPQA(大学院レベルの質問と回答)とMATH(競技レベルの数学問題)でLlama 3.3 70B、Qwen 2.5、GPT-4oを上回る。GPQA(大学院レベルのSTEM問題)とMATH(数学競技)では、その教師モデルであるGPT-40さえも上回る。またHumanEvalとHumanEval+で測定されるコーディングでも、他のどのオープンウェイトモデルよりも高いスコアを記録している。

Phi-4の知識カットオフは2024年6月である。このモデルの学習データにはこの日付までの情報が含まれている。

ローカルでの実行方法

Ollamaを使う場合(推奨 - 最も簡単):

ターミナルを開き、コマンドollama run phi4を実行する。このコマンドは2つの動作を行う。Ollamaライブラリからモデルの重みをダウンロードし、直ちに対話型チャットセッションを起動する。

Phi-4-miniには次を使用する:ollama run phi4-mini

OllamaはWindowsでGPU検出を自動的に処理する。GPUはNVIDIA、AMD(ROCm)、Apple Siliconで自動検出される。OllamaはデフォルトでQ4_K_Mを使用する。8GBのGPUでは、あふれたレイヤーを自動的にCPU RAMへオフロードする。

LM Studioを使う場合(GUIベース):

LM Studio 0.4.12はWindows 10と11でPhi-4とPhi-4-miniを完全にサポートする。チャットインターフェース、モデル比較、GUIを備えたローカルサーバーモードを提供し、コマンドラインは不要である。Discoverタブで「Phi-4」を検索し、DownloadをクリックしてからRunするだけでよい。

その他のサポートツール:

OllamaやLM Studioのようなツールを使えば、Qwen 3、Gemma 3、DeepSeek-R1のようなモデルをコンシューマーハードウェア上で実行できる。そしてPhi-4は、Jan、GPT4All、Mstyを含む他のプラットフォームでも広く利用可能である。

最適なユースケース

  • 数学とSTEMの推論 - Phi-4は数学の問題解決、科学的概念の分析、多段階の論理的証明の作業において卓越している。
  • コード生成とデバッグ - コーディングベンチマークでの強い性能により、ソフトウェア開発支援に理想的である。
  • ローカルのプライバシー重視アプリケーション - データをクラウドサービスに送ることなく、自分のハードウェア上で完全にオフラインでAIを実行する。
  • リソースが制約された環境 - 控えめなコンシューマーGPU(12GB VRAM)やCPUのみのシステムでも配備できる。
  • 教育・研究ツール - 高い推論品質でドキュメントを分析し、概念を説明し、学習教材を生成する。
  • 大規模なコスト効率の良い推論 - 初期のハードウェア投資の後は、大量使用でもトークンあたりのコストはゼロである。

注:Phi-4は、特定のタスク、特に関連する事実知識に関するハルシネーションにおいて、そのサイズによって根本的に制限されている。

よくある質問

8GBのGPU VRAMを持つラップトップでPhi-4を実行できますか?

はい、ただしCPUオフロードを伴う。Q4_K_MのPhi-4は約9GBを必要とし、RTX 4060 8GBの上限を約1GB超える。Ollamaとllama.cppは、一部のレイヤーをシステムRAMに保持することで自動的に超過分を処理する。モデルは動作するが、12GBのGPUより約50%遅い。

Phi-4とPhi-4-miniの違いは何ですか?

Phi-4は14Bパラメータであるのに対し、Phi-4-miniは3.8Bパラメータで、推論と128Kコンテキストタスクに最適化されている。Phi-4-miniはより効率的だがわずかに性能が低く、Phi-4はより高いVRAM要件を代償に、より強力な推論を提供する。

Phi-4は商用利用は無料ですか?

はい。Phi-4 14BはMITの下でリリースされており、商用利用、改変、再配布を許可する寛容なオープンソースライセンスである。

Phi-4はクラウドAPIと比べてどれくらい速いですか?

推定毎秒トークン数は、量子化が完全にVRAMに収まることを前提として、ミドルレンジGPUで毎秒20トークン程度、ハイエンドカードでは最大毎秒55トークンである。速度はハードウェアによって異なり、OllamaとLM Studioが最適化を自動的に処理する。

自分のパソコンでローカルAIが動くか気になりますか?

情報源とクレジット

元の情報源: Microsoft Foundry Labs + Hugging Face