Gemma 4 im Test: lokale Installation, GPU-Anforderungen und NSFW-Richtlinie

Gemma 4 ist die neue Open-Weight-Modellfamilie von Google DeepMind für Entwickler, die ein lokales oder selbst gehostetes LLM im Google-Umfeld testen möchten. Die Reihe umfasst…

schedule
article 4 Min. Lesezeit
Titelbild zum Gemma 4 Test

Gemma 4 ist die neue Open-Weight-Modellfamilie von Google DeepMind für Entwickler, die ein lokales oder selbst gehostetes LLM im Google-Umfeld testen möchten. Die Reihe umfasst E2B, E4B, 12B, 26B-A4B und 31B.

Für die Praxis sollte man Gemma 4 nach Variante bewerten. 31B zielt auf Qualität, 26B-A4B auf Effizienz, 12B ist der realistischere Einstieg für viele Desktop-Nutzer. Offizielle Modelle sind sicherheitsabgestimmt; auf Hugging Face gibt es zusätzlich Community-Varianten mit uncensored oder abliterated Ausrichtung.

Was ist Gemma 4?

Gemma 4 ist eine Open-Weight-Modellfamilie von Google DeepMind auf Basis der Gemini-3-Forschung. Die offizielle Modellkarte nennt E2B, E4B, 12B, 26B-A4B und 31B, bis zu 256K Kontext, Text- und Bildeingabe sowie Audio bei ausgewählten kleineren Varianten.

Gemma 4 model card
Die offizielle Gemma-4-Modellkarte zeigt Größen, Modalitäten, Kontextlänge und Sicherheitshinweise.

Praktisch betrachtet sind E2B/E4B leichtgewichtig, 12B eignet sich für lokale Tests, 26B-A4B betont aktive Effizienz und 31B ist die schwerere Qualitätsvariante.

Offizielle Downloads

Modell Geeignet für Download
Gemma 4 31B IT Qualitätsorientierte lokale Tests Hugging Face 31B IT
Gemma 4 26B-A4B IT Effizienz und Durchsatz Hugging Face 26B-A4B IT
Gemma 4 12B IT Erster Test auf Consumer-GPUs Hugging Face 12B IT
Gemma 4 model card Spezifikationen und Sicherheit Google AI Developers
Gemma 4 31B IT
Gemma 4 31B IT ist das dichte Modell für qualitätsorientierte Tests.
Gemma 4 26B-A4B IT
Gemma 4 26B-A4B IT legt Wert auf Active-Parameter-Effizienz.

Leistung und Praxiseindruck

Offiziell stehen Intelligenz pro Parameter, langer Kontext, multimodale Eingabe und Entwicklerfreundlichkeit im Vordergrund. Praktisch sollte man eigene Aufgaben testen: Code, lange Zusammenfassungen, lokales RAG, gemischtes Schreiben, strukturierte Extraktion und Bildfragen können andere Ergebnisse liefern.

Gemma 4 12B IT
Gemma 4 12B IT ist auf Consumer-GPUs leichter zu testen.

Vergleich mit lokalen LLMs

Modell Hinweis
Gemma 4 Google-Open-Weights, langer Kontext, multimodal und klare Dokumentation.
Qwen 3.8 Sehr stark bei Mehrsprachigkeit, Code und CJK/Englisch-Aufgaben.
Llama Riesiges Ökosystem für Quantisierung und Fine-Tunes.
DeepSeek Häufiger Vergleich bei Reasoning und Code.
Mistral / Mixtral Reifes Ökosystem für MoE und offene Deployments.

Lokale Installation

Für den ersten lokalen Test reicht Transformers. Für API, Batching oder höheren Durchsatz sind vLLM oder SGLang sinnvoll. Bei großen Modellen zählen VRAM, Quantisierung und Kontext.

pip install -U transformers accelerate torch safetensors python - <<'PY' from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "google/gemma-4-12B-it" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="auto", device_map="auto") PY

GPU- und Hardware-Anforderungen

Variante VRAM Hinweis
Gemma 4 31B IT BF16 60GB+ / 80GB GPU preferred 24GB braucht 4-bit und kurzen Kontext.
Gemma 4 26B-A4B IT Large total weights Weniger aktive Parameter heißt nicht kleine Gewichte.
Gemma 4 12B IT 16GB-24GB comfortable / lower with quantization Bester lokaler Einstieg.

Online nutzen, wenn die Hardware nicht reicht

Google AI Studio ist der direkteste Weg ohne starke GPU: Prompts, Kontext und API testen, bevor große Gewichte geladen werden.

Google AI Studio
Google AI Studio ist der einfachste Weg, wenn die lokale GPU nicht reicht.

NSFW, Uncensored und Abliterated-Modelle

Offizielle Gemma-4-Modelle und Google AI Studio sind keine unbegrenzten NSFW-Chats. Erwachsene, gefährliche, illegale oder sensible Inhalte können abgelehnt oder vorsichtig beantwortet werden.

Wer Ablehnungsverhalten untersucht, findet auch Gemma 4 26B-A4B Uncensored / Heretic und Gemma 4 31B Abliterated. Das sind Community-Modelle, keine offiziellen Google-Versionen.

Gemma 4 Heretic
Heretic ist eine uncensored Community-Variante und keine offizielle Google-Version.
Gemma 4 Abliterated
Die 31B-Abliterated-Variante soll Ablehnungsverhalten reduzieren.

FAQ

Welches Gemma 4 sollte man zuerst laden?

Mit einer normalen GPU zuerst 12B oder eine quantisierte Version testen, danach 26B-A4B oder 31B.

Läuft 31B auf 24 GB VRAM?

BF16 ist unrealistisch; nur mit Quantisierung und kurzem Kontext.

Sind Uncensored-Varianten offiziell?

Nein. Heretic und Abliterated sind Community-Derivate auf Hugging Face.

Fazit

Gemma 4 passt zu Nutzern, die Google-Open-Weights, langen Kontext, Multimodalität und klare Dokumentation suchen. Sinnvoll ist zuerst AI Studio oder 12B, danach 26B-A4B oder 31B.

Quellen

Anmelden

ODER

Konto erstellen

Passwort muss 8-20 Zeichen lang sein und Buchstaben und Zahlen enthalten

ODER

Passwort Vergessen

Passwort muss 8-20 Zeichen lang sein und Buchstaben und Zahlen enthalten