ローカルAI · Hugging Face & Alibaba Qwen Official
Qwen 2.5:AlibabaのオープンLLM完全ガイド
写真: Bhautik Patel Unsplashより
Qwen2.5はQwen大規模言語モデルの最新シリーズで、0.5Bから72Bパラメータまでの7つのサイズで利用可能である。モデルは18兆トークンで学習され、29以上の言語をサポートし、ほとんどのサイズがApache 2.0ライセンスの下にある。Qwen2.5は、コーディングと数学の分野における専門エキスパートモデルのおかげで、これらの領域での能力が大幅に向上している。
Qwen 2.5とは何か
Qwen2.5はQwen大規模言語モデルの最新シリーズである。18兆トークンと、教師ありファインチューニングや多段階強化学習を含む洗練されたポストトレーニング技術を基盤とし、Qwen2.5は、より大規模なプロプライエタリシステムに匹敵する競争力のあるオープンウェイトモデルを生み出そうとするAlibabaの取り組みを代表するものである。
Qwen2.5は、コーディングと数学の分野における専門エキスパートモデルのおかげで、これらの領域での能力が大幅に向上している。指示追従、長文生成(8Kトークン超)、構造化データ(例:表)の理解、構造化出力(特にJSON形式)の生成において、大きな進歩を示している。
利用可能なサイズと変種
Qwen2.5は、0.5B、1.5B、3B、7B、14B、32B、72Bの7つのサイズで事前学習済みモデルと指示チューニング済みモデルを提供している。単一のリリースで100以上のモデルが利用可能で、7つのパラメータサイズにわたるベース版と指示版、さらに専門化されたQwen2.5-CoderとQwen2.5-Math変種、加えてGGUF、AWQ、GPTQの量子化版が含まれる。
ベース版と指示チューニング版モデル:
- ベースモデルは事前学習済みで、継続的なファインチューニングに適している
- 指示チューニング版はチャットや会話用に最適化されている(ほとんどのユーザーに推奨)
専門化された変種:
- Qwen2.5-Coderはコーディングアプリケーション向けに特別に設計されている
- Qwen2.5-Mathは、思考の連鎖+ツール統合推論(Chain-of-Thought + Tool-Integrated Reasoning)パイプラインを備えた専門的な数学推論のファインチューニングを提供する
ライセンス:
- 大多数のモデルはApache 2.0の下でライセンスされているが、Qwen2.5-3BとQwen2.5-72BはそれぞれQwen Research LicenseとQwen Licenseに基づいて管理されている
ハードウェア要件
0.5B(ラップトップ/スマートフォン/Raspberry Pi)から72B(デュアル3090のフラッグシップ)までの範囲は、あらゆる環境に合うQwen 2.5変種があることを意味する。以下は一般的な量子化での典型的なVRAM要件である:
| モデル | Q4_K_M(推奨) | FP16(フル精度) | 最小GPU |
|---|---|---|---|
| 0.5B | 約400MB | 約1GB | Raspberry Pi 5 / スマートフォン |
| 1.5B | 約1.5GB | 約3GB | 4GB RAM |
| 3B | 約2GB | 約6GB | 8GB RAM |
| 7B | 約5.5GB | 約14GB | RTX 4060(8GB) |
| 14B | 約8.5GB | 約28GB | RTX 4070(12GB) |
| 32B | 約19.5GB | 約64GB | RTX 4090(24GB) |
| 72B | 約45GB | 約144GB | デュアルA100(40GB) |
ほとんどのモデルは128K(131,072)トークンのコンテキスト長をサポートし、最大8Kトークンを生成できるため、広範なテキスト出力の生成が可能である。
量子化のヒント:
- Q4_K_Mは品質とVRAMのトレードオフにおける推奨スイートスポット
- Q8_0はより多くの精度を保つが、2倍のVRAMを必要とする
- Q3/Q2量子化はメモリが厳しいときの緊急の代替策
ベンチマークのハイライト
Qwen2.5は標準的な評価全体で競争力のある性能を示している:
- MATHベンチマークでは、Qwen2.5-7B/72B-Instructのスコアは52.9/69.0から75.5/83.1に上昇した
- Qwen2.5-72BはMMLUやBBHのような一般的なタスクで優れ、79.7と78.2のスコアを達成し、より大きなサイズの競合他社を上回る
- Qwen2.5-14BとQwen2.5-32Bは、同等またはより大きなサイズのベースラインモデルを上回り、モデルサイズと能力の間で最適なバランスを達成している
コーディング性能:
- Qwen 2.5-Coder-32BはLiveCodeBenchで37.2%を記録し、GPT-4oの29.2%を打ち負かす
- 72BモデルのSWE-Bench Verified(実世界のバグ修正)での36.5%のスコアは、GPT-4oの23.6%とClaude 3.5 Sonnetの33.4%を上回る
ローカルでの実行方法
Ollamaでの最速の始め方:
次でQwen2.5-7Bをインストールして起動する:ollama pull qwen2.5:7b
7Bサイズはローカルマシンで最も人気のある選択肢である。品質、速度、ハードウェア要件のバランスが取れている。
その他のツール: Ollama以外では、LM Studioがローカルモデル用のChatGPTのようなインターフェースを提供する。その他のオプションには以下が含まれる:
- Jan - シンプルなデスクトップUI
- GPT4All - ワンクリックのモデル管理
- Msty - 軽量な代替
これらはすべてインストール後、Hugging Faceから直接モデルを取得する。
Pythonへの直接統合: カスタムワークフローには、Hugging Face Transformersを通じて任意のモデルを読み込む:
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B-Instruct")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-7B-Instruct")
最適なユースケース
-
多言語サポート(29以上の言語): Qwen2.5は中国語、英語、フランス語、スペイン語、ポルトガル語、ドイツ語、イタリア語、ロシア語、日本語、韓国語、ベトナム語、タイ語、アラビア語を含む29以上の言語をサポートする。国際的なチームに理想的である。
-
エッジとモバイルへの配備: わずか30億パラメータのモデルでも、今や極めて競争力のある結果を提供する。0.5Bと1.5Bサイズはスマートフォンや組み込みデバイスで動作する。
-
コード生成と修正: Qwen2.5-Coder変種はより大きなオープンモデルを上回る。プロプライエタリなクラウドサービスなしでGitHub Copilotのような機能に使用できる。
-
長コンテキスト検索(RAG): 128Kコンテキストを持つ3Bモデルは珍しい提供である。ほとんどの5B未満モデルは8~32Kコンテキストが上限であり、Qwen 2.5 3Bを、取得されるコンテキストが長くなる可能性があるオンデバイスRAGワークフローの信頼できる候補にしている。
-
プライバシーが重要なアプリケーション: Qwenをローカルで実行することでプライバシーが確保され、APIコストが排除される。
よくある質問
ラップトップにはどのQwen 2.5サイズを選べばよいですか?
Qwen2.5-7Bは約5.5GBのVRAMを必要とし、RTX 4060/4070でおおよそ毎秒60~75トークンで動作する。8GBのGPUがあれば、7Bモデルが理想的である。12GB以上なら、14B変種がやや遅い速度で著しく良い品質を提供する。
Qwen 2.5は本当にオープンソースですか?
大多数のモデルはApache 2.0の下でライセンスされているが、Qwen2.5-3BとQwen2.5-72BはそれぞれQwen Research LicenseとQwen Licenseに基づいて管理されている。Apache 2.0は商用利用を許可し、他の2つのライセンスはいくつかの制限付きで研究利用と商用利用を許可する。商用配備の前にHugging Faceでライセンス条項を確認されたい。
Qwen 2.5はLlama 3.1とどう比較されますか?
Qwen 2.5 72Bは、5分の1の活性パラメータで、いくつかのベンチマークにおいてLlama 3.1 405Bを上回る。Metaの405Bはリリース当時最大のオープンフラッグシップだったが、Qwen 2.5は多くの標準テストでより良い性能を示す証拠を持っている。
Qwen 2.5をMacで実行できますか?
はい。18GB以上のユニファイドメモリを持つMシリーズのMacならどれでも、Qwen2.5-Coder 14BをQ5_K_M以上で実行できる。M4 Pro 24GBはQ6_Kでコンテキストの余裕を持った強い体験を提供する。ベースのQwen2.5モデルは同様かそれ以下の要件である。
情報源とクレジット