Qwen 3.8レビュー|性能・ローカル導入・必要GPU・NSFW対応を解説
Qwen 3.8は、Alibaba Cloud/Qwenチームの最新世代LLMとして、巨大なQwen3.8-2.4T-A95B系と、個人・小規模チームでも試しやすいQwen3.8-27B系を同時に意識して見るべきモデルです。結論から言うと、Max系はGPT-5、Claude、Geminiの上位モデルに近い領域を狙うクラウド/大規模運用向け、27BはローカルLLMユーザーが実際に触りやすい主役候補です。
特に重要なのは、名前だけで判断しないことです。Qwen3.8-2.4T-A95Bは2.4Tパラメータ級のMoEモデルで、ローカルPCに入れて気軽に動かすサイズではありません。一方、Qwen3.8-27BはApache-2.0で公開され、BF16のままでは重いものの、量子化版やvLLM/SGLang系の最適化を使えば、ローカル検証の現実味がぐっと上がります。
目次
Qwen 3.8とは
Qwen 3.8は、Qwen3.5/Qwen3.6で広がったQwen系オープンモデルの流れを引き継ぐ新世代モデルです。Hugging Face上では、2.4Tパラメータ級のQwen3.8-2.4T-A95B、そのFP8版、より扱いやすいQwen3.8-27B、27BのFP8版などを確認できます。

Qwen3.8-2.4T-A95Bのモデルカードでは、vLLM、SGLang、TokenSpeedなどとの互換性が示されています。さらに、Qwen3.8-MaxはこのA95B系をベースに、視覚入力、non-thinking対応、デフォルト1M context、公式ビルトインツールなどを加えた公式サービス版として案内されています。
一方のQwen3.8-27Bは、モデルページ上で28Bパラメータ、BF16、Apache-2.0ライセンスとして表示されます。大規模クラウド向けのMax系とは違い、27BはローカルLLMの比較対象として見やすく、RTX 4090級、RTX 6000 Ada級、Mac Studio級、クラウドGPUなどで試す読者にとって現実的です。

公開モデルとダウンロード先
| モデル | 主な用途 | ライセンス/形式 | おすすめの使い方 |
|---|---|---|---|
| Qwen3.8-2.4T-A95B | Max系の基盤となる超大型MoEモデル | qwen3.8-maxライセンス / Safetensors / BF16 | 研究、クラウド推論、大規模サービング検証 |
| Qwen3.8-2.4T-A95B-FP8 | 2.4T系をより低メモリで扱うためのFP8版 | qwen3.8-maxライセンス / FP8量子化 | vLLM/SGLang/TokenSpeedでの大規模推論 |
| Qwen3.8-27B | ローカル検証しやすい27B級モデル | Apache-2.0 / Safetensors / BF16 | 個人・小規模チームのローカルLLM、RAG、コード補助 |
| Qwen3.8-27B-FP8 | 27Bのメモリ負担を抑える版 | Apache-2.0 / FP8量子化 | VRAM節約、サーバー運用、量子化比較 |
| ModelScope版Qwen3.8-2.4T-A95B | ModelScope環境での取得 | Safetensors | 中国国内回線やModelScope利用者向け |


ダウンロード先を選ぶなら、グローバル環境ではHugging Face、ModelScopeを使っている環境ではModelScopeが自然です。2.4T系はファイル容量だけでなくサービング構成も重いため、まず27Bや27Bの量子化版でプロンプト傾向、推論速度、長文処理を確認してから、Max系をクラウドで評価する流れが無理ありません。
性能評価とユーザーの反応
公式側の説明では、Qwen3.8-MaxはQwen史上もっとも強い世代として位置づけられ、長文、エージェント、ツール利用、コード、推論、多言語対応を広く伸ばしたモデルとされています。モデルカードにも1M context、公式ビルトインツール、vision inputなどが示されており、チャットだけでなく業務ワークフローへの組み込みを意識した設計です。
コミュニティ側では、公開直後からHugging Faceのダウンロード数、27Bの扱いやすさ、FP8版の実用性、vLLM/SGLangでの対応状況がよく話題になります。Qwen3.8-27Bは27B級としては強い期待を集めていますが、長いコンテキスト、画像入力、ツール利用を含めた実運用では、公式オンライン版とローカル版の差を分けて評価する必要があります。

実際に導入する前は、ベンチマーク表だけで決めず、自分の用途に近いテストを作るのが大切です。日本語の要約、コード修正、長文PDFのRAG、社内FAQ、ローカルでの画像付き質問など、必要なタスクで20〜30問ほど比較すると、Qwen 3.8がGemma、Llama、DeepSeek、Kimi、GLM系より合うか判断しやすくなります。
主流ローカルLLMとの比較
| モデル | Qwen 3.8との違い | 向いている人 |
|---|---|---|
| Qwen3.8-27B | 多言語、コード、画像テキスト入力、ローカル運用のバランスが良い。Apache-2.0で扱いやすい。 | 日本語/英語/中国語を混ぜるユーザー、ローカルLLMを実用寄りに使いたい人 |
| Qwen3.8-2.4T-A95B / Max | 性能の上限は高いが、個人PCではなくクラウド・大規模推論向け。 | 企業検証、API提供、研究チーム、GPUクラスタを持つユーザー |
| Llama 4系 | 英語圏のエコシステムや派生モデルが厚い。Qwenはアジア言語とコードで競争力がある。 | 英語中心ならLlama、日中英混在ならQwenも候補 |
| Gemma 3系 | 軽量モデルの扱いやすさはGemmaが強い。Qwen3.8は性能重視寄り。 | ノートPCや小型GPUならGemma、余裕あるGPUならQwen |
| DeepSeek V4系 | DeepSeekは推論・コード・MoE大規模運用で強い。Qwenは公式サービス、Vision、27Bの扱いやすさが魅力。 | 推論特化ならDeepSeek、汎用ローカル検証ならQwen |
| Kimi / GLM系 | 長文や中国語圏のエージェント用途で競合。QwenはHugging Face/ModelScopeで入手しやすい。 | 中国語資料や長文処理を重視するユーザー |
ローカル導入方法
Qwen3.8-27Bをまず触るなら、Transformers、vLLM、SGLangのいずれかが現実的です。単発の検証はTransformers、APIサーバー化はvLLM、MoEや高スループットの検証はSGLang/TokenSpeed系を検討すると分かりやすいです。

Transformersでモデルを読む場合は、GPUメモリと依存関係に注意します。最新のTransformers、Accelerate、Torchを入れ、必要に応じてdevice_map="auto"や量子化を使います。
pip install -U transformers accelerate torch safetensors python - <<'PY' from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "Qwen/Qwen3.8-27B" tok = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained( model_id, torch_dtype="auto", device_map="auto", trust_remote_code=True, ) messages = [{"role": "user", "content": "Qwen 3.8の特徴を3点で説明してください。"}] text = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True) inputs = tok([text], return_tensors="pt").to(model.device) out = model.generate(**inputs, max_new_tokens=512) print(tok.decode(out[0], skip_special_tokens=True)) PY vLLMでサーバー化する場合は、モデル対応状況とGPU構成を先に確認します。27Bなら単体GPUや複数GPUで現実的に試しやすく、2.4T系はテンソル並列、専門家並列、FP8、KV cache最適化などを含む本格的な構成が前提になります。
pip install -U vllm vllm serve Qwen/Qwen3.8-27B \ --trust-remote-code \ --dtype bfloat16 \ --max-model-len 32768 必要ハードウェア
必要VRAMは、モデルサイズ、量子化、コンテキスト長、同時接続数で大きく変わります。以下は安全側に見た目安です。実際にはKV cache、画像入力、batch size、推論エンジンの最適化で上下します。
| 使い方 | 目安VRAM | コメント |
|---|---|---|
| Qwen3.8-27B BF16 | 約56GB以上 + KV cache | A6000/RTX 6000 Ada 48GBでは長文時に厳しい場合がある。80GB級GPUが快適。 |
| Qwen3.8-27B 8bit/FP8 | 約28〜36GB以上 | 48GB GPUや複数GPUで現実的。精度と速度のバランスを確認したい。 |
| Qwen3.8-27B 4bit量子化 | 約18〜24GB以上 | RTX 4090 24GB級で短〜中コンテキストなら試しやすい。長文ではメモリ増加に注意。 |
| Qwen3.8-2.4T-A95B BF16 | 数TB級のVRAM/メモリ構成 | 個人PC向けではなく、クラウドGPUクラスタや企業内サービング向け。 |
| Qwen3.8-2.4T-A95B-FP8 | BF16より軽いが依然として大規模 | FP8対応GPU、vLLM/SGLang、分散推論の知識が必要。 |
ローカルで試す順番としては、まず27Bの量子化版、次に27B BF16またはFP8、最後にクラウドで2.4T系を評価する流れが自然です。家庭用PCでいきなり2.4T系を動かそうとすると、ダウンロード容量、ストレージ、VRAM、推論速度のすべてがボトルネックになります。
GPUが足りない場合のオンライン利用
手元のGPUが足りない場合は、Qwen ChatまたはQwen公式サイトからオンライン版を使うのが一番簡単です。Qwen Chatはログインしてすぐ試せるため、ローカル環境を組む前に、文章作成、要約、コード、画像付き質問、長文処理の癖を確認できます。

企業利用では、Qwen Cloud / Alibaba Cloud側のAPIを確認すると、モデル選択、コンテキスト長、ツール利用、課金、データ管理をまとめて設計しやすくなります。ローカル導入は自由度が高い反面、GPU費用、セキュリティ、更新、監視、障害対応を自分で持つ必要があります。
NSFW・フィルター突破 / 検閲回避
Qwenの公式オンラインサービスは、一般的な商用AIサービスと同じく、安全ポリシーと利用規約の範囲内で動きます。露骨な性的コンテンツ、違法行為、危険な行為、他者への被害につながる内容は制限される可能性があります。
オープンウェイトをローカルで動かす場合、オンラインサービスのUIフィルターとは挙動が変わります。ただし、モデルが安全性調整を受けていること、配布ライセンスやプラットフォーム規約、法律上の制約が残ることは同じです。フィルター突破 / 検閲回避だけを目的に導入するより、社内データを外に出さない、RAGを自前で組む、低コストに大量処理する、といった正当な用途で評価する方が実用的です。
Qwen3.8-27B Uncensored / Abliteratedについて
ローカル環境で制限の少ない派生モデルを試したい場合、Hugging Faceには Huihui-Qwen3.8-27B-abliterated も公開されています。これはQwen3.8-27Bをベースにしたコミュニティ製の uncensored / abliterated 版であり、Qwen公式のリリースではありません。一般に「abliterated」と呼ばれるモデルは、拒否応答の傾向を弱める調整が行われており、公式チャットや安全調整済みモデルでは断られやすいプロンプトにも答えやすくなります。
用途としては、ローカル検証、アライメント研究、創作・ロールプレイ用途での挙動比較などが考えられます。一方で、フィルター突破 / 検閲回避に近い使い方がしやすくなるため、成人向け・危険・法的に問題のある内容へ誘導されるリスクも高くなります。実際に使う場合は、Hugging Face上のモデルカード、ライセンス、利用するプラットフォームの規約、地域の法律を必ず確認してください。
通常の用途では、まず公式のQwen3.8-27BやQwen Chatを使うほうが扱いやすく安全です。Abliterated版は、モデルのホスティングや出力管理を理解している上級者向けのローカル選択肢として考えるのが現実的です。
よくある質問
Qwen 3.8は無料で使えますか?
Hugging FaceやModelScopeで公開されているウェイトはダウンロードして試せます。ただし、2.4T系は必要なGPU環境が非常に大きく、実質的にはクラウドや企業環境向けです。個人なら27Bまたは量子化版から始めるのが現実的です。
Qwen3.8-MaxとQwen3.8-2.4T-A95Bは同じですか?
完全に同じと考えない方が安全です。モデルカードでは、Qwen3.8-MaxはQwen3.8-2.4T-A95Bをベースに、vision input、non-thinking対応、1M context、公式ビルトインツールなどを加えた公式版として説明されています。ローカルのA95B系ウェイトと、オンラインのMaxサービスでは機能差があります。
日本語性能は期待できますか?
Qwen系は多言語、とくに日本語・中国語・英語の混在処理で評価されることが多いモデルです。ただし、敬語、長文の自然さ、専門分野の正確さは用途次第です。日本語記事、メール、翻訳、要約で使うなら、自分の文体に近いテストを用意してClaude、GPT、Gemini、DeepSeekと比較すると判断しやすくなります。
RTX 4090 24GBで動きますか?
27Bの4bit量子化版なら、短めのコンテキストで試せる可能性があります。BF16のフル精度や長いコンテキストは厳しいため、量子化、コンテキスト長、batch sizeを下げる必要があります。2.4T系はRTX 4090単体では現実的ではありません。
商用利用できますか?
Qwen3.8-27BはApache-2.0として表示されており、商用利用を検討しやすいモデルです。一方、2.4T-A95B系はqwen3.8-maxライセンスなので、商用利用や再配布の前にライセンス本文を確認してください。オンライン版を使う場合は、Qwen/Alibaba Cloud側の利用規約も別途確認が必要です。
ローカル導入とオンライン利用はどちらが良いですか?
短期的に試すだけならオンライン版が速いです。機密データ、独自RAG、大量推論、コスト最適化が必要ならローカル/自社運用の価値が出ます。GPU管理やモデル更新の手間を避けたい場合は、APIやQwen Chatから始める方が失敗しにくいです。
まとめ
Qwen 3.8は、Max級の大規模モデルと27B級の実用モデルを同時に押さえると理解しやすいシリーズです。最先端性能を狙うならQwen3.8-Max / 2.4T-A95B、ローカルLLMとして実際に試すならQwen3.8-27Bが中心になります。
読者が最初にやるべきことは、Hugging Faceで27Bのモデルカードとライセンスを確認し、短いテストプロンプトで自分の用途に合うか見極めることです。ローカルで十分に動かせない場合でも、Qwen ChatやQwen Cloudを使えば、モデルの文章品質、ツール利用、長文処理の感触を先に確認できます。
一方、2.4T系は名前のインパクトが大きいぶん、導入コストも非常に高いモデルです。個人PCで無理に動かすより、量子化版、クラウドGPU、API利用を含めて比較し、自分のワークフローに対して本当に価値が出るかを見てから採用するのが安全です。