ローカルAI · Official model documentation and technical reports (Hugging Face, Meta, Mistral AI, Alibaba, Microsoft, Google)
オープンウェイトLLM 5種比較:Llama、Mistral、Qwen、Phi、Gemma
写真: Umberto Unsplashより
5つの主要なオープンウェイト言語モデルファミリー(Llama 3.2、Mistral/Mixtral、Qwen 2.5、Phi-4、Gemma 2)の詳細な比較で、パラメータサイズ、コンテキスト長、ライセンス、主な強みを網羅する。このガイドは、開発者が自らのハードウェア制約とユースケースに最適なモデルを選ぶのに役立つ。
なぜこの5つのモデルファミリーを比較するのか
オープンウェイトLLMの状況は、主要なAIラボからの実行可能な選択肢で爆発的に広がっている。各ファミリーは、パラメータ数、コンテキストウィンドウ、推論速度、推論能力の間で異なるトレードオフを行っている。エッジデバイスに配備するにせよ、コーディングアシスタントを構築するにせよ、多言語ドキュメントを処理するにせよ、これら5つのファミリーは現在のパレートフロンティアを代表しており、すべてがコンシューマーハードウェア上でローカルに動作する。ダウンロードして配備する前に、それらの仕様を理解することが不可欠である。
比較表
| モデルファミリー | パラメータサイズ | 最大コンテキスト | ライセンス | 発行元 | 際立った強み |
|---|---|---|---|---|---|
| Llama 3.2 | 1B、3B、11B*、90B* | 128K | Llama Community | Meta | オンデバイス配備(1B/3B) |
| Mistral/Mixtral | 7B、8x7B(合計46.7B) | 32K | Apache 2.0 | Mistral AI | コード生成と推論速度 |
| Qwen 2.5 | 0.5B~72B | 128K(1M Turbo) | Apache 2.0 | Alibaba | 長コンテキスト処理、多言語 |
| Phi-4 | 3.8B、14B、5.6B* | 16K、128K* | MIT | Microsoft | パラメータあたりの推論品質 |
| Gemma 2 | 2B、9B、27B | 8K | Gemma Terms | 効率的な密なモデル |
*ビジョン/マルチモーダル変種。Llama 3.2の11B/90Bは画像理解を追加し、Phi-4マルチモーダルは128Kコンテキストを追加し、GemmaはGemma 4で256Kを計画している。
Llama 3.2の概要
Llama 3.2には、小規模・中規模のビジョンLLM(11Bと90B)、および軽量なテキスト専用モデル(1Bと3B)が含まれる。1Bと3Bモデルは128Kトークンのコンテキスト長をサポートし、要約、指示追従、書き換えタスクなど、エッジでローカルに動作するオンデバイス用途において、そのクラスで最先端である。
主な仕様:最大9兆トークンで学習され、128kトークンの長いコンテキスト長をサポートする。Llama 3.2の使用はLlama 3.2 Community License(カスタムの商用ライセンス契約)に基づいて管理され、月間アクティブユーザーが7億人を超える場合はMetaにライセンスを申請する必要がある。
最適な用途:モバイル配備、要約、エッジAI、リソースが制約されたデバイスでの指示追従タスク。
Mistral / Mixtralの概要
Mistralは7Bパラメータの言語モデルで、大規模モデルのスケーリングコストと性能および効率的な推論のバランスに焦点を当てている。対照的に、Mixtralは合計46.7Bのパラメータを持つが、トークンごとに12.9Bのパラメータのみを使用し、12.9Bモデルと同じ速度と同じコストで入力の処理と出力の生成を行う。
主な仕様:Mixtralは32kトークンのコンテキストを優雅に処理する。両者ともApache 2.0の下でライセンスされている。Mixtralはコード生成で強い性能を示す。
最適な用途:コード生成、控えめなGPUでの効率的な推論、トークンあたりのコスト最適化、多言語ワークフロー。
Qwen 2.5の概要
Qwen 2.5のリリースには、0.5Bから72Bまでのサイズにわたる7つのオープンソースモデルが含まれる。ほとんどのモデルは128K(131,072)トークンのコンテキスト長をサポートし、最大8Kトークンを生成できる。
主な仕様:18兆トークンでの学習と、教師ありファインチューニングや多段階強化学習を含む洗練されたポストトレーニング技術。QwenモデルはApache License 2.0の下でリリースされており、これは自由な使用、改変、配布(商用利用を含む)を許可する寛容なオープンソースライセンスで、著作権表示と免責事項の保持を要求する。拡張コンテキストも利用可能:Qwen2.5-1Mは最大1Mトークンのコンテキスト長をサポートする長コンテキスト版である。
最適な用途:多言語アプリケーション、長コンテキストのドキュメント処理、大規模な指示追従(72B変種)、密な推論。
Phi-4の概要
Microsoft Phi-4は140億パラメータのデコーダーのみのTransformerモデルで、高度な推論能力を効率的に提供するために開発され、計算とメモリが限られた環境での配備を可能にする。Phi-4は16,000トークンのコンテキスト長をサポートし、広範な長文コンテンツを処理・生成できる。
主な仕様:約10兆(10T)トークンで学習されている。Phi-4は寛容なMIT Licenseを備え、商用アプリケーションに使用できる。重要な革新は、学習コーパスの大部分を占める高品質の合成データの戦略的な使用にある。
最適な用途:数学的推論、複雑な論理問題、科学的な質問応答、リソースが制約された商用配備。
Gemma 2の概要
Gemma 2は、90億と270億パラメータの2つのサイズで、ベース版(事前学習済み)と指示チューニング版がある。Gemma 2モデルは、最初のイテレーションの約2倍のデータで学習され、27B版は合計13兆トークン、9B版は8兆トークンのウェブデータ(主に英語)、コード、数学から成る。
主な仕様:8192トークンのコンテキスト長、回転位置埋め込み(RoPE)の使用。Gemma 2は、再配布、ファインチューニング、商用利用、派生作品を許可する寛容なライセンス(カスタムのGemma Terms of Use)を備える。スライディングウィンドウアテンションは1層おきに適用され(ローカル - 4096トークン)、その間の層は依然として完全な二次のグローバルアテンション(8192トークン)を使用する。これは長コンテキスト状況での品質を高めつつ、スライディングアテンションの利点を部分的に享受する方法である。
最適な用途:バランスの取れた汎用利用、オンデバイス配備(2B)、TPU/GPUでの効率的な推論、教育と研究。
どのモデルを選ぶべきか
控えめなハードウェア(4~8GBのVRAM以下)の場合:
- エッジ/モバイル配備が必要ならLlama 3.2 1B
- 同じフットプリントでより良い推論を求めるならPhi-4-mini(3.8B)
- 軽量な指示チューニング済みチャットならGemma 2 2B
ミドルレンジのハードウェア(12~24GBのVRAM)の場合:
- 長コンテキストタスクならQwen 2.5 7BまたはLlama 3.2 3B
- 数学的推論とコーディングならPhi-4 14B
- 汎用でバランスの取れた性能ならGemma 2 9B
本格的なコーディングタスクの場合:
- 効率的な推論を伴う最高のコード生成ならMixtral 8x7B
- 複雑なコード生成と推論ならQwen 2.5 32B-72B
- 数学を多用するアルゴリズム設計ならPhi-4 14B
多言語または言語横断の作業の場合:
- Qwen 2.5(29以上の言語で明示的に学習)
- Mistral 7B/Mixtral(フランス語、ドイツ語、スペイン語、イタリア語、英語をサポート)
- 英語中心で構わないのでなければGemma 2は避ける
最大のコンテキスト長の場合:
- Qwen 2.5-TurboまたはQwen 2.5-1M(最大1Mトークン、128Kで本番対応)
- Qwen 2.5の128K変種(7B~72B)
- 最大128KのPhi-4変種(マルチモーダル版)
ライセンスが明確な商用配備の場合:
- Phi-4(MIT - 表示以外の制限なし)
- Mistral/Mixtral(Apache 2.0 - 寛容、ユーザー閾値なし)
- Qwen 2.5(Apache 2.0 - Mistralと同じ)
- 避けるべき:Llama(7億MAUの閾値)、Gemma(フローダウン義務を伴うカスタムTerms)
純粋な効率(推論速度+低VRAM)の場合:
- Mistral 7B(スライディングウィンドウアテンション)
- Mixtral 8x7B(疎なMoE - トークンごとに13Bが活性)
- Phi-4-mini 3.8B(密、高品質データ)
よくある質問
これらのモデルを制限なく商用利用できますか?
同じようにはいかない。Phi-4は寛容なMIT Licenseを備え、商用アプリケーションに使用できる。Mistral、Mixtral、Qwen 2.5はすべてApache 2.0(制限なし)を使用している。Llama 3.2は商用利用を許可するが、製品が月間7億アクティブユーザーを超える場合はMetaからの別途ライセンスが必要である。Gemma 2は商用配備を許可するが、標準的なオープンソースライセンスではなく、カスタムのGemma Terms of Useの下である。
RTX 4090やRTX 4070のようなコンシューマーGPUで動作するモデルはどれですか?
5.6Bパラメータと128Kトークンのコンテキスト長を持つPhi-4 Multimodalは、オンデバイス実行と低レイテンシ推論の両方に最適化されている。Qwen 2.5 7B-14B、Mistral 7B、Llama 3.2 3B、Gemma 2 9Bはすべて、12~24GBのVRAMに効率的に収まるよう量子化できる。最良の互換性のためには、4ビットまたは8ビット量子化(GGUF、AWQ、またはbitsandbytes形式)を使用するとよい。
実際のドキュメント作業ではコンテキスト長はどう比較されますか?
ほとんどのQwen 2.5モデルは128K(131,072)トークンのコンテキスト長をサポートし、最大8Kトークンを生成でき、Llama 3.2と同等である。MistralとMixtralは32Kが上限である。Gemma 2は8Kに制限されており、完全なドキュメント処理には適していない。Phi-4の16Kはより良いが、それでも控えめである。本番の長コンテキスト利用には、Qwen 2.5が明確な勝者である。
合成学習データ(Phi-4)は多様なインターネットデータより優れていますか?
タスクによる。Phi-4の高品質な合成データの戦略的な使用は、マルチエージェントプロンプティング、指示反転、自己修正ワークフローなどの技術を用いて生成され、強力な推論と問題解決能力を獲得することを可能にし、しばしばより大きなパラメータ数のモデルを上回る。これは数学、論理、コードに非常によく効くが、Qwen 2.5やLlamaの広範な学習が輝く自由形式の創造的タスクや事実に基づくタスクにはあまり効かない。