Llama 4 評測|Scout、Maverick、Behemoth、本機部署與 NSFW 政策解析
Llama 4 是 Meta 把 Llama 系列帶進原生多模態與 MoE 架構的重要版本。這一代最值得注意的不是單一模型,而是 Scout、Maverick、Behemoth 三個定位不同的組合:Scout 強調超長上下文,Maverick 更像通用多模態助手,Behemoth 則是用來蒸餾與訓練的超大型教師模型。
如果你想要結論:Scout 適合研究長文件、RAG、巨大程式碼庫;Maverick 適合需要圖片理解、聊天、程式與多模態應用的團隊;Behemoth 不適合一般讀者下載部署。若你的硬體只有一般消費級顯卡,Llama 4 並不是最輕鬆的本機模型,Qwen、Gemma、Llama 3.x 或 Mistral 類模型通常更實際。
目錄
快速結論
| 項目 | Llama 4 評測 |
|---|---|
| 最適合 | 多模態應用、長上下文 RAG、程式助手、私有化部署、想降低封閉 API 依賴的團隊 |
| Scout | 10M token 上下文,較適合長文與部署實驗 |
| Maverick | 整體聊天、圖片理解與程式能力更完整,但硬體要求更高 |
| Behemoth | 教師模型,不是一般下載部署用模型 |
| 線上使用 | Meta AI |
| 下載 | Llama 官方下載、Llama 4 Scout、Llama 4 Maverick |
| NSFW | 官方服務與 Instruct 模型有安全對齊;開放權重可自主管理部署,但沒有官方 NSFW 模式 |
Llama 4 是什麼

Llama 4 於 2025 年 4 月由 Meta 發表。Scout 與 Maverick 是開放權重模型,可透過官方管道與 Hugging Face 下載;Behemoth 則是更大規模的教師模型,主要用於把能力蒸餾到較小版本。
這代的核心變化有兩個。第一是原生多模態,也就是文字與圖片在同一模型架構中處理,對截圖、文件、圖表、介面和照片理解更自然。第二是 MoE,模型會根據輸入啟用部分專家,而不是每次都動用全部參數,因此能在龐大總參數與較低活躍計算量之間取得平衡。
Scout、Maverick、Behemoth 差異
| 模型 | 公開狀態 | 參數 | 上下文 | 適合用途 |
|---|---|---|---|---|
| Llama 4 Scout | 開放權重 | 17B active / 109B total / 16 experts | 10M tokens | 長文件、巨大程式碼庫、多文件分析 |
| Llama 4 Maverick | 開放權重 | 17B active / 400B total / 128 experts | 1M tokens | 聊天、圖片理解、程式、多模態產品 |
| Llama 4 Behemoth | 預覽教師模型 | 288B active / 接近 2T total | 非一般下載部署 | 蒸餾、研究、上限能力探索 |
Scout 最大賣點是上下文長度。10M token 代表它有機會處理整本書、長期專案紀錄或大型程式碼庫,但實際效果仍取決於推論框架、檢索設計、提示詞和記憶體配置。
Maverick 的定位更像主力助手。它的總參數更大、專家數更多,適合圖片理解、一般問答、創作和程式任務。不過它比 Scout 更重,通常更適合雲端或伺服器端使用。
線上使用與下載地址
一般使用者可以先從 Meta AI 試用。開發者可從 llama.com 官方下載頁 進入,模型權重則可查看 Llama 4 Scout Hugging Face 與 Llama 4 Maverick Hugging Face。商用產品上線前,務必閱讀 Llama 4 Community License 與 使用政策。
本機部署與硬體需求
Meta 對 Scout 的說法是,在 Int4 量化下可放入單張 NVIDIA H100 等級 GPU;Maverick 則更適合 H100 DGX 或多 GPU 伺服器。這代表它不是 8GB、12GB、24GB 顯卡可以輕鬆完整運行的模型。
| 環境 | 實際建議 |
|---|---|
| 8GB-16GB GPU | 改用較小的 Qwen、Gemma、Llama 3.x、Mistral 量化模型 |
| 24GB GPU | 仍不適合完整 Scout/Maverick |
| H100 級 GPU | Scout 可作為測試目標 |
| 多 GPU 伺服器 | Maverick 較合理 |
| 雲端推論 | 多數團隊最有效率的入門方式 |
效能與真實評價
Meta 官方資料強調 Scout 的長上下文、Maverick 的性價比和 Behemoth 的 STEM 能力。這些資訊能說明 Llama 4 的方向:更長的上下文、更好的圖片理解,以及更適合建構產品的開放權重模型。
不過 Maverick 的排行榜表現曾引起討論。部分媒體指出,高分版本與一般公開權重並不完全相同。因此比較 Llama 4 時,不應只看單一榜單,而要用自己的文件、圖片、程式碼與任務流程測試。
與其他開放模型比較
| 模型 | 強項 | 限制 | 適合人群 |
|---|---|---|---|
| Llama 4 Scout | 超長上下文、原生多模態 | 硬體門檻高 | 長文件與 RAG 團隊 |
| Llama 4 Maverick | 整體多模態能力強 | 部署成本高 | 雲端 AI 產品 |
| Qwen 3.8 | 本機生態成熟 | 上下文規模較不極端 | 實用本機 LLM |
| Gemma 4 | 效率與 Google 生態 | 官方版非 NSFW 專用 | 一般本機助手 |
| Dolphin 3 | 無審查路線、角色扮演 | 非前沿多模態 MoE | 重視自由度的使用者 |
| Kimi K3 | 大型 MoE 與長上下文 | 更偏企業基礎設施 | 企業 Agent/RAG |
NSFW 與審查限制
Llama 4 官方服務不是 NSFW 生成工具。Meta AI 與官方 Instruct 模型都有安全對齊,涉及未成年人、非自願內容、真實人物性化、違法指令等內容通常會被限制。
開放權重讓自架者能控制系統提示、審核層和部署方式,但這不等於官方提供無審查模式。若主要需求是成人向角色扮演或低拒答率,Dolphin 類無審查模型或社群微調模型通常更直接。
社群與生態
Llama 系列的優勢一直是生態。雲端供應商、推論框架、安全工具、微調教程、RAG 範例通常會快速跟進。不過 Llama 4 的 MoE 與多模態讓部署比一般 dense LLM 更複雜,使用量化版時要確認圖片輸入、上下文長度和 Scout/Maverick 行為是否完整保留。
常見問題
Llama 4 是開源嗎?
更精確地說是開放權重。權重可下載,但仍要遵守 Meta 的 Llama 4 Community License 和使用政策。
Llama 4 可以在一般電腦跑嗎?
完整 Scout/Maverick 不適合一般電腦。Scout 至少應以 H100 級硬體作為比較現實的測試起點。
Scout 和 Maverick 怎麼選?
需要超長上下文選 Scout;需要更好的通用多模態聊天與圖片理解,且能接受較高成本,選 Maverick。
Llama 4 支援圖片嗎?
支援。Scout 與 Maverick 都是原生多模態模型,可以處理文字與圖片輸入。
Llama 4 適合 NSFW 嗎?
官方版本不適合當成 NSFW 專用模型。自架可提高控制度,但仍需自行承擔安全與合規責任。
參考資訊
- Meta Llama 4 official announcement
- Llama 4 Scout on Hugging Face
- Llama 4 Maverick on Hugging Face
- Official Llama downloads
- Llama 4 Community License
- Llama 4 acceptable use policy
- TechCrunch benchmark report
- TechCrunch Maverick follow-up
總結
Llama 4 是一個值得關注的開放權重系列,尤其在長上下文、多模態和 MoE 架構上,比 Llama 3 世代更往前一步。Scout 適合長文處理與部署實驗,Maverick 適合伺服器端的通用多模態產品。
但它不是所有人的最佳選擇。一般本機使用者應先比較 Qwen、Gemma、Mistral、Llama 3.x 等更輕量模型;重視 NSFW 的使用者也應認清官方模型的安全限制。對開發者來說,最好的做法是先透過 Meta AI 或雲端推論測試真實任務,再決定是否投入本機或私有化部署。