Gemma 4 im Test: lokale Installation, GPU-Anforderungen und NSFW-Richtlinie
Gemma 4 ist die neue Open-Weight-Modellfamilie von Google DeepMind für Entwickler, die ein lokales oder selbst gehostetes LLM im Google-Umfeld testen möchten. Die Reihe umfasst…
Gemma 4 ist die neue Open-Weight-Modellfamilie von Google DeepMind für Entwickler, die ein lokales oder selbst gehostetes LLM im Google-Umfeld testen möchten. Die Reihe umfasst E2B, E4B, 12B, 26B-A4B und 31B.
Für die Praxis sollte man Gemma 4 nach Variante bewerten. 31B zielt auf Qualität, 26B-A4B auf Effizienz, 12B ist der realistischere Einstieg für viele Desktop-Nutzer. Offizielle Modelle sind sicherheitsabgestimmt; auf Hugging Face gibt es zusätzlich Community-Varianten mit uncensored oder abliterated Ausrichtung.
Inhalt
Was ist Gemma 4?
Gemma 4 ist eine Open-Weight-Modellfamilie von Google DeepMind auf Basis der Gemini-3-Forschung. Die offizielle Modellkarte nennt E2B, E4B, 12B, 26B-A4B und 31B, bis zu 256K Kontext, Text- und Bildeingabe sowie Audio bei ausgewählten kleineren Varianten.

Praktisch betrachtet sind E2B/E4B leichtgewichtig, 12B eignet sich für lokale Tests, 26B-A4B betont aktive Effizienz und 31B ist die schwerere Qualitätsvariante.
Offizielle Downloads
| Modell | Geeignet für | Download |
|---|---|---|
| Gemma 4 31B IT | Qualitätsorientierte lokale Tests | Hugging Face 31B IT |
| Gemma 4 26B-A4B IT | Effizienz und Durchsatz | Hugging Face 26B-A4B IT |
| Gemma 4 12B IT | Erster Test auf Consumer-GPUs | Hugging Face 12B IT |
| Gemma 4 model card | Spezifikationen und Sicherheit | Google AI Developers |


Leistung und Praxiseindruck
Offiziell stehen Intelligenz pro Parameter, langer Kontext, multimodale Eingabe und Entwicklerfreundlichkeit im Vordergrund. Praktisch sollte man eigene Aufgaben testen: Code, lange Zusammenfassungen, lokales RAG, gemischtes Schreiben, strukturierte Extraktion und Bildfragen können andere Ergebnisse liefern.

Vergleich mit lokalen LLMs
| Modell | Hinweis |
|---|---|
| Gemma 4 | Google-Open-Weights, langer Kontext, multimodal und klare Dokumentation. |
| Qwen 3.8 | Sehr stark bei Mehrsprachigkeit, Code und CJK/Englisch-Aufgaben. |
| Llama | Riesiges Ökosystem für Quantisierung und Fine-Tunes. |
| DeepSeek | Häufiger Vergleich bei Reasoning und Code. |
| Mistral / Mixtral | Reifes Ökosystem für MoE und offene Deployments. |
Lokale Installation
Für den ersten lokalen Test reicht Transformers. Für API, Batching oder höheren Durchsatz sind vLLM oder SGLang sinnvoll. Bei großen Modellen zählen VRAM, Quantisierung und Kontext.
pip install -U transformers accelerate torch safetensors python - <<'PY' from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "google/gemma-4-12B-it" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="auto", device_map="auto") PY GPU- und Hardware-Anforderungen
| Variante | VRAM | Hinweis |
|---|---|---|
| Gemma 4 31B IT | BF16 60GB+ / 80GB GPU preferred | 24GB braucht 4-bit und kurzen Kontext. |
| Gemma 4 26B-A4B IT | Large total weights | Weniger aktive Parameter heißt nicht kleine Gewichte. |
| Gemma 4 12B IT | 16GB-24GB comfortable / lower with quantization | Bester lokaler Einstieg. |
Online nutzen, wenn die Hardware nicht reicht
Google AI Studio ist der direkteste Weg ohne starke GPU: Prompts, Kontext und API testen, bevor große Gewichte geladen werden.

NSFW, Uncensored und Abliterated-Modelle
Offizielle Gemma-4-Modelle und Google AI Studio sind keine unbegrenzten NSFW-Chats. Erwachsene, gefährliche, illegale oder sensible Inhalte können abgelehnt oder vorsichtig beantwortet werden.
Wer Ablehnungsverhalten untersucht, findet auch Gemma 4 26B-A4B Uncensored / Heretic und Gemma 4 31B Abliterated. Das sind Community-Modelle, keine offiziellen Google-Versionen.


FAQ
Welches Gemma 4 sollte man zuerst laden?
Mit einer normalen GPU zuerst 12B oder eine quantisierte Version testen, danach 26B-A4B oder 31B.
Läuft 31B auf 24 GB VRAM?
BF16 ist unrealistisch; nur mit Quantisierung und kurzem Kontext.
Sind Uncensored-Varianten offiziell?
Nein. Heretic und Abliterated sind Community-Derivate auf Hugging Face.
Fazit
Gemma 4 passt zu Nutzern, die Google-Open-Weights, langen Kontext, Multimodalität und klare Dokumentation suchen. Sinnvoll ist zuerst AI Studio oder 12B, danach 26B-A4B oder 31B.