Gemma 4 評測:本機部署、GPU 需求與 NSFW 政策
Gemma 4 是 Google DeepMind 最新的開放權重 Gemma 系列,適合想在本機或自架環境中使用 Google 系模型的開發者。它不是單一模型,而是從輕量 E2B/E4B 到 12B、26B-A4B、31B 的完整系列。
如果你關心本機部署、GPU 需求、線上體驗與 NSFW 政策,Gemma 4 值得分版本來看。31B 偏品質,26B-A4B 偏效率,12B 比較適合一般顯卡先測試;官方模型較安全對齊,社群也有 uncensored / abliterated 派生版本。
目錄
Gemma 4 是什麼
Gemma 4 是 Google DeepMind 基於 Gemini 3 研究成果推出的開放模型系列。官方 model card列出 E2B、E4B、12B、26B-A4B、31B 五種大小,並提到最長 256K context、文字與圖片輸入,以及部分小型模型的音訊支援。

簡單來說,E2B/E4B 偏邊緣與輕量用途,12B 適合一般本機測試,26B-A4B 看 active parameter 效率,31B 則是品質導向的重型本機模型。
官方下載地址
| 模型 | 適合用途 | 下載 |
|---|---|---|
| Gemma 4 31B IT | 品質優先、本機或伺服器測試 | Hugging Face 31B IT |
| Gemma 4 26B-A4B IT | 效率與吞吐量測試 | Hugging Face 26B-A4B IT |
| Gemma 4 12B IT | 一般顯卡先測試 | Hugging Face 12B IT |
| Gemma 4 model card | 確認規格、授權與安全資訊 | Google AI Developers |


效能與實際使用感
官方定位強調知能對參數效率、長 context、多模態輸入與開發者易用性。實際評估時,不應只看榜單,而要用自己的任務測試:程式碼修改、長文摘要、本機 RAG、日英混合寫作、結構化抽取和圖片問答會得到不同排名。

與主流本機 LLM 比較
| 模型 | 說明 |
|---|---|
| Gemma 4 | Google 系開放權重、長 context、多模態與清楚的安全文件。 |
| Qwen 3.8 | 多語言、程式碼與中日英混合任務非常強。 |
| Llama | 社群、量化與微調資源最豐富。 |
| DeepSeek | 推理與程式碼領域常被拿來比較。 |
| Mistral / Mixtral | MoE 與歐洲開源部署生態成熟。 |
本機部署方法
第一次本機測試建議從 Transformers 開始;需要 API 服務、batching 或更高吞吐量時,再看 vLLM 或 SGLang。大型模型請先確認 VRAM、量化格式和 context 長度。
pip install -U transformers accelerate torch safetensors python - <<'PY' from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "google/gemma-4-12B-it" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="auto", device_map="auto") PY GPU 與硬體需求
| 版本 | VRAM | 說明 |
|---|---|---|
| Gemma 4 31B IT | BF16 60GB+ / 80GB GPU preferred | 24GB 需要 4bit 與短 context。 |
| Gemma 4 26B-A4B IT | Large total weights | active parameter 少不代表總權重小。 |
| Gemma 4 12B IT | 16GB-24GB comfortable / lower with quantization | 最適合作為第一個本機測試。 |
硬體不足時的線上使用方式
Google AI Studio 是硬體不足時最直接的選擇,可先測試提示詞、長文與 API 流程,再決定是否下載大型權重。

NSFW、Uncensored 與 Abliterated 模型
官方 Gemma 4 與 Google AI Studio 都不是無限制 NSFW 聊天服務。成人、危險、違法或政策敏感內容可能被拒絕或被安全化回答。
研究拒答行為的使用者也會看到 Gemma 4 26B-A4B Uncensored / Heretic 與 Gemma 4 31B Abliterated。它們是社群版本,不是 Google 官方模型。


常見問題
應該先下載哪個 Gemma 4?
一般顯卡建議先從 12B 或量化版開始,再評估 26B-A4B 或 31B。
24GB GPU 能跑 31B 嗎?
BF16 不現實,量化和短 context 才有機會。
Uncensored 版本是官方的嗎?
不是。Heretic 和 Abliterated 是 Hugging Face 上的社群派生模型。
總結
Gemma 4 適合想要 Google 系開放權重、長 context、多模態輸入和清楚安全文件的讀者。先用 AI Studio 或 12B 測試,再決定是否部署 26B-A4B 或 31B,是最穩妥的流程。