Reupload
PCチェック
ホームに戻る

ローカルAI · Mistral AI, Hugging Face, ArXiv

Mistral & Mixtral:オープンウェイトLLMを実行する

Mistral & Mixtral:オープンウェイトLLMを実行する

写真: Sandip Kalal Unsplashより

Mistral AIは2023年12月に初のオープンなMoEモデルをリリースし、パラメータ数以上の性能を発揮する効率的な言語モデルとしての評判を確立した。Mixtral 8x7Bは合計46.7Bのパラメータを持ちながら、その3分の1のサイズのモデルと同じ速度とコストで推論を実行し、より新しい変種もApache 2.0ライセンスの下で利用可能であり、コンシューマーハードウェア上でプライベートでカスタマイズ可能なAI配備を可能にする。

Mistral / Mixtralとは何か

Mistral Large 3は世界で最も優れた寛容なオープンウェイトモデルの一つであり、画期的なMixtralシリーズ以来となるMistral初のMixture-of-Expertsモデルである。Mistralファミリーは、密な(dense)モデル(7B、24B、128B)と疎なMixture-of-Experts変種の両方を包含する。Mixtral 8x7Bは、それぞれ7Bパラメータの8つのエキスパートネットワークを使用し、トークンごとに2つのエキスパートのみが活性化する。つまり、47Bの総パラメータの恩恵を受けながら、約13Bの活性パラメータで動作する。

Mixtralモデルファミリーは、ルーターが各トークンを処理するエキスパートネットワークのサブセットを選択する疎なMixture-of-Experts(SMoE)アーキテクチャを採用している。この設計は卓越した効率性をもたらす。Mixtral 8x7Bは70Bの密なモデルに近い品質を、13Bモデルの推論コストで提供する。

利用可能なサイズと変種

オープンウェイトのMistral / Mixtralラインナップには以下が含まれる:

  • Mistral 7B - 70億パラメータの事前学習済み生成テキストモデルで、ベース版と指示チューニング版が利用可能
  • Mixtral 8x7B - 合計46.7Bパラメータで、その3分の1のサイズのモデルと同じ速度とコストで推論を実行し、32kトークンのコンテキスト長を持つ
  • Mixtral 8x22B - 合計141Bパラメータのうち39Bの活性パラメータを持つ疎なMixture-of-Expertsで、64Kトークンのコンテキストウィンドウを備える
  • Mistral Small 3.1 - 240億パラメータで、最先端の視覚理解と128kトークンのコンテキスト機能を持つ
  • Mistral Large 3 - 41Bの活性パラメータと675Bの総パラメータを持つ、最先端の汎用マルチモーダル・グラニュラーMixture-of-Expertsモデル

すべてのオープンウェイト変種はApache 2.0ライセンスの下でリリースされ、無制限の研究利用と商用利用を可能にしている。

ハードウェア要件

VRAMの必要量はモデルサイズと量子化によって大きく異なる:

  • Mistral 7B:Q4またはQ5量子化で6~8GBのVRAM
  • Mixtral 8x7B:Q4量子化で24GBのVRAM(部分オフロードで重みは約28.4GB)
  • Mixtral 8x22B:Q4で48GB以上のVRAM(重みは約85.9GB、合計約97GB)

MoEモデルは、トークンごとに少数のエキスパートしか活性化しないとしても、すべてのエキスパートをVRAMに保持する必要がある。4ビット量子化のMixtral 8x7Bは約28GBを必要とし、単一のNVIDIA RTX 5090 32GBに収まる。

システムレベルの仕様としては、最低16GBのRAM(32GB推奨)、最近の8コアCPU、モデルファイル用に100~500GBの空き容量を持つNVMe SSDが挙げられる。Mac(Apple Silicon)はユニファイドメモリとMLXランタイムのおかげで優れており、WindowsはNVIDIA + CUDAとの組み合わせが最適で、LinuxはAMD ROCmサポートを含む最も幅広いGPUの柔軟性を提供する。

ベンチマークのハイライト

Mixtral 8x7Bは12のベンチマークのうち9つでLlama 2 70Bを上回った。より具体的には、Mixtralはフランス語、ドイツ語、スペイン語、イタリア語においてLlama 2 70Bを大幅に上回る。

Mixtral 8x7BはMMLUで約70%を達成し、これはMistral 7Bよりも意味のある形で優れている。Mixtralは32kトークンのコンテキストを扱え、コード生成において強い特徴を示し、合計46.7億パラメータを持ちながらトークンごとに12.9億のみを使用するため、速度とコスト効率の両方を維持している。

Mistral 8x7Bは最近のベンチマークで43.1にランクされ、Mistral Large 3(45.7)とMinistral 3 14B Reasoning(47.3)に次ぐ。フロンティアの能力については、Mistral Large 3は一般的なプロンプトで最高の指示チューニング済みオープンウェイトモデルと同等の性能を達成し、画像理解を示すとともに多言語会話でクラス最高の性能を発揮し、LMArenaリーダーボードのOSS非推論モデル部門で初登場2位となった。

ローカルでの実行方法

最も簡単な方法はOllamaである。これはコマンドライン優先のランタイムで、軽量なバックグラウンドサーバーとOpenAI互換APIを備えている。ollama.comからインストールし、次を実行する:

ollama run mixtral:8x7b

8x22B変種には次を使用する:ollama run mixtral:8x22b。Ollamaのライブラリには、Llama、Qwen、DeepSeek、Mistral、Gemma、そしてOpenAIのオープンウェイトgpt-ossシリーズにわたる200以上の即実行可能なモデルが並び、それぞれ適切なプロンプトテンプレートで事前設定されている。

代替ツールもMistral / Mixtralモデルをサポートしている:

  • LM Studio - コマンドを入力するよりも閲覧してクリックしたい人向けの洗練されたデスクトップGUIで、ローカルAPIサーバーも実行する
  • Jan - 最も人気があり見た目も優れたローカルLLMアプリケーションの一つで、ChatGPTに対するプライバシー優先の代替
  • GPT4All - 三者の中で最も初心者向けで、厳選された小さめのモデルリストとシンプルなワンクリックインストール体験を提供

Ollamaはllama.cppの上に構築されており、インテリジェントなメモリ管理と、NVIDIA(CUDA)、Apple Silicon(Metal)、AMD(ROCm)GPU向けの効率的なGPUアクセラレーションにより、優れた毎秒トークン数を実現する。

最適なユースケース

Mixtral 8x7Bは、テキスト要約、質問応答、テキスト分類、テキスト補完、コード生成に理想的である。Mistral 7Bはテキスト要約、分類、テキスト補完、コード補完をサポートする。

コードと技術的タスク:Mistral 7BはコードタスクでCodeLlama 7Bの性能に迫りながら、英語の言語タスクでも高い能力を維持する。Mixtral 8x22Bは141Bのうち39Bの活性パラメータのみを使用し、比類のないコスト効率を提供し、強力な数学とコーディング能力、ネイティブの関数呼び出しを備える。

ドキュメント処理とRAG:Mixtral 8x22Bの64Kトークンのコンテキストウィンドウは、大きなドキュメントからの正確な情報想起を可能にし、検索拡張生成や長文ドキュメントの要約に優れている。

多言語ワークフロー:Mixtral 8x22Bはネイティブの多言語能力を持ち、フランス語、ドイツ語、スペイン語、イタリア語のHellaSwag、Arc Challenge、MMLUベンチマークでLLaMA 2 70Bを大きく上回る。

本番推論:Mixtral 8x7Bは、計算リソースやレイテンシが限られているときに、カスタマイズやファインチューニングのためにオープンウェイトモデルを必要とする本番環境に適している。

よくある質問

Mixtral 8x7BをゲーミングPCで実行できますか?

はい、ただし条件付きである。4ビット量子化のMixtral 8x7Bは約28GBを必要とし、単一のNVIDIA RTX 5090 32GBに収まる。RTX 3090(24GB)のような古いカードではレイヤーオフロード技術が必要となる。8GBしかない場合はMistral 7Bから始めるとよい。これは約4.4GBに量子化される。

密なMistral 7Bと疎なMixtral 8x7Bではどちらが速いですか?

Mixtral 8x7Bは、トークンごとに8つのエキスパートのうち2つしか活性化しないため、70Bの密なモデルに近い品質を13Bモデルの推論コストで提供する。Mistral 7Bはより小さく読み込みが速いが、Mixtralはその疎なアーキテクチャのおかげで同等の速度でより良い品質を提供する。

Mistralモデルは商用利用しても安全ですか?

はい。ベース版と指示ファインチューニング版の両方がApache 2.0ライセンスの下でリリースされており、企業と開発者コミュニティ全体にわたるさらなるカスタマイズの強固な基盤を提供する。研究利用や本番利用にライセンス上の制限は適用されない。

Mixtral 8x22BはMistral Large 3とどう比較されますか?

Mixtral 8x22Bは2025年3月をもって廃止され、新しい統合にはMistral Small 4が推奨される。Mistral Large 3は、41Bの活性パラメータと675Bの総パラメータを持つ最先端の汎用マルチモーダルMixture-of-Expertsモデルで、優れた性能を提供するが48GB以上のVRAMを必要とする。コンシューマーハードウェアでのローカル配備には、Mixtral 8x7BまたはMistral Small 3.1が実用的なスイートスポットであり続ける。

自分のパソコンでローカルAIが動くか気になりますか?

情報源とクレジット

元の情報源: Mistral AI, Hugging Face, ArXiv