Llama 4レビュー|Scout・Maverick・Behemoth、ローカル導入、NSFW対応まで解説
Llama 4は、Metaが公開したLlamaシリーズ初の本格的なネイティブ・マルチモーダルMoE世代です。ScoutとMaverickはオープンウェイトとして配布され、Behemothはその背後にある大型の教師モデルとして位置付けられています。この記事では、単に「強いかどうか」ではなく、どのモデルを、どの用途で、どの程度のハードウェアや予算で使うべきかまで整理します。
結論から言うと、Llama 4 Scoutは長文コンテキストを試したい人に最も面白く、Maverickはホスト型環境で使う汎用マルチモーダルAIとして有力です。一方、Behemothは通常のローカル利用向けダウンロードモデルではありません。ローカルLLM全体で比較するなら、Qwen 3.8レビュー、Gemma 4レビュー、Dolphin 3レビュー、DeepSeek V4レビュー、Kimi K3レビューもあわせて読むと位置付けが分かりやすいです。
目次
早わかり結論
| 項目 | Llama 4レビュー |
|---|---|
| 向いている用途 | マルチモーダルアプリ、長文RAG、コード支援、プライベート導入、クローズドAPI以外の選択肢を持ちたいチーム |
| Scout向きの人 | 長大コンテキストを重視し、Llama 4の中では比較的導入しやすいモデルを試したい人 |
| Maverick向きの人 | より強いチャット品質、画像理解、コード支援をホスト型環境で使いたい人 |
| 向かない人 | 小型GPUで気軽に動かしたい人、完全な無審査NSFWチャットを求める人、Apache系の完全に緩いライセンスだけを求める人 |
| オンライン利用 | Meta AIおよびMeta系アプリ連携 |
| ダウンロード | llama.comの公式ダウンロード, Hugging FaceのLlama 4 Scout, Hugging FaceのLlama 4 Maverick |
| NSFW | 公式サービスと公式Instructモデルは安全調整あり。オープンウェイトで運用制御は可能だが、公式NSFWモードはありません |
Llama 4とは

Llama 4は2025年4月5日にMetaから発表されました。公開された中心モデルは、ダウンロード可能なLlama 4 ScoutとLlama 4 Maverick、そしてプレビュー扱いの大型教師モデルLlama 4 Behemothです。Llama 3系との大きな違いは、Mixture-of-Experts構造とネイティブ・マルチモーダル対応にあります。
ネイティブ・マルチモーダルとは、画像理解を外付けツールのように扱うのではなく、テキストと画像を同じモデル基盤の中で扱う設計です。公式ではEarly Fusionと説明されており、スクリーンショット、文書画像、UI、図表、写真などを自然に読み取る用途で意味があります。
MoEは、入力ごとに一部のExpertだけを動かす仕組みです。総パラメータを大きくしながら、1トークンあたりの計算量を抑えられます。ただし、全Expertをメモリ上に保持する必要はあるため、家庭用GPUで急に軽く動くという意味ではありません。
Scout・Maverick・Behemothの違い
| モデル | 公開状況 | パラメータ | コンテキスト | 主な用途 |
|---|---|---|---|---|
| Llama 4 Scout | オープンウェイトで配布 | 17B active、109B total、16 experts | 10M tokens | 長文処理、複数文書、巨大コードベース、導入検証 |
| Llama 4 Maverick | オープンウェイトで配布 | 17B active、400B total、128 experts | 1M tokens | 汎用チャット、コード、画像理解、マルチモーダルアプリ |
| Llama 4 Behemoth | プレビューの教師モデル | 288B active、約2T total、16 experts | 通常の公開ダウンロード対象ではない | 蒸留、研究方向、Metaの上位モデル |
Scoutの最大の特徴は10Mトークン級のコンテキストです。Llama 3時代の128K前後の感覚から見ると非常に大きな伸びで、長いコードベース、複数の文書、過去ログの解析などに向きます。ただし、長文を入れれば必ず正確になるわけではなく、検索・要約・プロンプト設計・推論基盤の品質も大きく影響します。
Maverickは、より汎用的なマルチモーダル助手としての位置付けです。17B activeという数字だけを見ると小さく見えますが、128 Expert、総パラメータ約400BのMoEモデルであり、画像理解、創作、コード、推論をバランスよく狙っています。個人のPCより、ホスト型推論やサーバー導入向けです。
Behemothは誤解されやすい存在です。読者が普通にダウンロードして使うモデルというより、ScoutとMaverickの性能を引き上げるための巨大な教師モデルです。Llama 4世代の上限を示す存在として見るのが自然です。
公式利用・ダウンロード先
すぐ試すなら、まずはMeta AIが入口です。MetaはWhatsApp、Messenger、Instagram DirectなどでもLlama 4ベースの体験を提供すると説明しています。ただし、国・アカウント・提供状況によって、利用できるモデルや機能は変わる可能性があります。
開発者向けにはllama.comの公式ダウンロードページがあります。Hugging Faceでは、meta-llama/Llama-4-Scout-17B-16E-Instructとmeta-llama/Llama-4-Maverick-17B-128E-Instructが中心です。モデルカードには、モダリティ、対応言語、ライセンス、Transformersでの使い方などが掲載されています。
商用利用では、Llama 4 Community LicenseとAcceptable Use Policyを確認してください。オープンウェイトではありますが、Apache 2.0のように条件が非常に緩いライセンスと同じではありません。
ローカル導入と必要ハードウェア
Llama 4は巨大MoEモデルとしては効率的ですが、一般的なローカルLLMのようにノートPCや普通のゲーミングGPUで簡単に動くモデルではありません。MetaはScoutについて、Int4量子化で単一のNVIDIA H100 GPUに収まると説明しています。Maverickは単一H100 DGXホスト、または分散推論での運用が現実的です。
| 環境 | 現実的な見方 |
|---|---|
| 8GB〜16GB GPU | Llama 4本体ではなく、Llama 3.x、Qwen、Gemma、Mistralなどの小型量子化モデル向き |
| 24GB GPU | Llama 4 Scout/Maverickの本格運用には厳しい |
| H100級GPU | Scoutは量子化と最適化次第で検証対象になる |
| H100 DGX / 複数GPUサーバー | Maverickや本格サービス運用向き |
| ホスト型API | 多くの開発者にとって最初に試すべきルート |
手元の環境でプライバシー重視のローカルAIを作りたいなら、Llama 4より小さいモデルの方が現実的です。Llama 4の品質を試したいなら、まずはMeta AIやクラウド推論で自分の用途に合うか確認する方が早いでしょう。
ベンチマークと実際の評判
Metaの発表では、Llama 4 ScoutとMaverickは非常に競争力の高いマルチモーダルモデルとして紹介されています。Scoutの10Mコンテキスト、Maverickの性能対コスト、BehemothのSTEM系ベンチマークは、Llama 4の強みを示す重要な情報です。
一方で、Maverickのベンチマークには注意点もあります。TechCrunchなどは、LM Arenaで高スコアを出したMaverickが、一般公開されたモデルそのものではなく、会話向けに最適化された実験版だったと報じました。その後、公開版Maverickを別途評価した結果は、発表時の印象より控えめだったとも伝えられています。
これはLlama 4が弱いという意味ではありません。むしろ、使うべき教訓は「ランキングだけで判断しない」ことです。自分のコード、文書、画像、プロンプト、レイテンシ条件で試して、ScoutとMaverickのどちらが合うかを確認するのが安全です。
主要オープンLLMとの比較
| モデル | 強み | 弱み | 向いている人 |
|---|---|---|---|
| Llama 4 Scout | 超長文コンテキスト、オープンウェイト、マルチモーダル | ハードウェア要求とツール成熟度 | 長文RAG、文書・コードベース解析 |
| Llama 4 Maverick | 汎用マルチモーダル助手として強い | 総サイズが大きく、ベンチマーク解釈に注意 | ホスト型でAIアプリを作る開発者 |
| Qwen 3.8 | ローカル導入の現実性、コード・推論のバランス | Llama 4ほどの長文スケールではない | 実用的なローカルLLMを探す人 |
| Gemma 4 | Google系の効率的なローカルモデル | 公式版はNSFW特化ではない | 普段使いのローカル助手 |
| Dolphin 3 | 無審査寄りの会話・創作・ロールプレイに強い | 最先端マルチモーダルMoEではない | 拒否の少なさを重視する人 |
| Kimi K3 | 巨大オープンウェイトMoEと長文処理 | Llama 4以上にインフラ寄り | 企業のAgent/RAG基盤 |
| Mistral / Mixtral | 成熟した欧州系オープンモデル生态 | 古いモデルは最新勢に劣る場面もある | 安定運用と多言語アプリ |
NSFW対応と審査制限
Llama 4はNSFW特化モデルではありません。公式Meta AIは安全フィルター付きで、公式Instructモデルも助手用途・視覚推論向けに安全調整されています。モデルカードやライセンスでも、Acceptable Use Policyへの準拠が求められます。
オープンウェイトであるため、自前運用ではシステムプロンプト、モデレーション、ログ、利用ルールを自分で設計できます。ただし、それは公式に無審査モードがあるという意味ではありません。成人向けロールプレイや拒否の少なさを主目的にするなら、Dolphin系の無審査モデルやコミュニティの専用微調整モデルの方が分かりやすい選択肢です。
ビジネス利用では、未成年、非同意、実在人物の性的利用、違法行為などに関する安全対策が重要です。審査制限を外すこと自体が目的になると、法務・信頼性・プラットフォーム規約のリスクが大きくなります。
コミュニティとエコシステム
Llamaシリーズの最大の強みは、モデル単体ではなくエコシステムです。クラウド事業者、推論ランタイム、Fine-tuning、RAG、評価ツール、安全モデル、プロンプト資産が揃いやすく、企業導入でも検討しやすい土台があります。
ただし、Llama 4は単純なテキスト専用Denseモデルではありません。MoEとマルチモーダル対応のため、量子化、llama.cpp系対応、Ollamaパッケージ、GUIツール連携などはモデルごとに成熟度が変わります。コミュニティ量子化版を使う場合は、画像入力、長文コンテキスト、Scout/Maverickの挙動が保たれているかを確認しましょう。
よくある質問
Llama 4は無料で使えますか?
ScoutとMaverickの重みはLlama 4 Community Licenseで配布されています。多くの用途で使えますが、大規模商用サービスや禁止用途ではライセンス確認が必要です。
Llama 4はローカルで動かせますか?
ScoutはLlama 4の中では現実的ですが、それでもH100級GPUと量子化・最適化が前提です。Maverickはサーバーまたはホスト型推論向けです。
Llama 4はLlama 3.3より強いですか?
マルチモーダルと長文コンテキストでは大きな進化です。ただし、小型ローカルチャットならLlama 3.xの方が軽く、運用しやすい場合があります。
Llama 4は画像を理解できますか?
はい。ScoutとMaverickはテキストと画像入力に対応するネイティブ・マルチモーダルモデルです。出力はテキストとコードが中心です。
Llama 4は無審査モデルですか?
いいえ。公式サービスと公式Instructモデルは安全調整されています。自前運用では制御の自由度がありますが、NSFW専用モデルではありません。
最初に試すならScoutとMaverickのどちらですか?
長文コンテキストを重視するならScout、より強い汎用チャットと画像理解をホスト型で試したいならMaverickが向いています。
参考情報
- Meta公式 Llama 4発表記事
- Hugging Face: Llama 4 Scoutモデルカード
- Hugging Face: Llama 4 Maverickモデルカード
- Llama公式ダウンロード
- Llama 4 Community License
- Llama 4 Acceptable Use Policy
- TechCrunch: Llama 4ベンチマーク表示に関する報道
- TechCrunch: 公開版Maverickの追加評価に関する報道
まとめ
Llama 4は、Llamaシリーズをネイティブ・マルチモーダルとMoEの時代へ進めた重要なリリースです。Scoutは長文コンテキスト、Maverickは汎用マルチモーダル性能で注目できます。
ただし、誰にでも最適なモデルではありません。小型GPUでのローカル運用やNSFW目的なら別モデルの方が実用的な場合があります。まずはMeta AIやホスト型推論で自分の用途に合うか試し、Qwen、Gemma、Dolphin、Kimi、DeepSeek、Mistralなどと比較して選ぶのが一番確実です。