Test de Gemma 4 : installation locale, GPU et politique NSFW
Gemma 4 est la nouvelle famille de modèles open-weight de Google DeepMind pour les développeurs qui veulent tester un LLM local ou auto-hébergé dans l’écosystème…
Gemma 4 est la nouvelle famille de modèles open-weight de Google DeepMind pour les développeurs qui veulent tester un LLM local ou auto-hébergé dans l’écosystème Google. Elle comprend des variantes E2B, E4B, 12B, 26B-A4B et 31B.
Pour l’évaluer correctement, il faut distinguer les versions. Le 31B vise la qualité, le 26B-A4B cherche l’efficacité, et le 12B reste l’entrée la plus réaliste pour beaucoup de GPU grand public. Les modèles officiels sont alignés sur la sécurité, tandis que la communauté propose déjà des variantes uncensored et abliterated.
Sommaire
Qu’est-ce que Gemma 4 ?
Gemma 4 est une famille de modèles open-weight de Google DeepMind issue des recherches Gemini 3. La fiche officielle liste E2B, E4B, 12B, 26B-A4B et 31B, avec jusqu’à 256K de contexte, entrée texte et image, et audio sur certaines petites variantes.

En pratique, E2B/E4B sont légers, 12B sert aux tests locaux, 26B-A4B vise l’efficacité active et 31B est la variante plus lourde orientée qualité.
Téléchargements officiels
| Modèle | Idéal pour | Téléchargement |
|---|---|---|
| Gemma 4 31B IT | Tests locaux orientés qualité | Hugging Face 31B IT |
| Gemma 4 26B-A4B IT | Efficacité et débit | Hugging Face 26B-A4B IT |
| Gemma 4 12B IT | Premier test sur GPU grand public | Hugging Face 12B IT |
| Gemma 4 model card | Spécifications et sécurité | Google AI Developers |


Performances et ressenti d’usage
Le discours officiel met l’accent sur l’intelligence par paramètre, le long contexte, le multimodal et l’usage développeur. En pratique, il faut tester ses propres tâches : code, résumé long, RAG local, écriture mixte, extraction structurée et image peuvent changer le classement.

Comparaison avec les LLM locaux
| Modèle | Note |
|---|---|
| Gemma 4 | Poids ouverts Google, long contexte, multimodal et documentation claire. |
| Qwen 3.8 | Très fort en multilingue, code et tâches chinois/japonais/anglais. |
| Llama | Écosystème immense de quantifications et fine-tunes. |
| DeepSeek | Souvent comparé en raisonnement et code. |
| Mistral / Mixtral | Écosystème mûr pour MoE et déploiements ouverts. |
Installation locale
Pour un premier test local, Transformers suffit. Pour API, batching ou meilleur débit, regardez vLLM ou SGLang. Sur les grands modèles, vérifiez VRAM, quantification et contexte.
pip install -U transformers accelerate torch safetensors python - <<'PY' from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "google/gemma-4-12B-it" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="auto", device_map="auto") PY Besoins GPU et matériel
| Variante | VRAM | Note |
|---|---|---|
| Gemma 4 31B IT | BF16 60GB+ / 80GB GPU preferred | 24 Go demande 4-bit et contexte court. |
| Gemma 4 26B-A4B IT | Large total weights | Moins de paramètres actifs ne signifie pas poids légers. |
| Gemma 4 12B IT | 16GB-24GB comfortable / lower with quantization | Meilleur point d’entrée local. |
Utilisation en ligne si le matériel ne suffit pas
Google AI Studio est la voie la plus directe sans GPU puissant : testez prompts, contexte et API avant de télécharger de gros poids.

NSFW, Uncensored et modèles Abliterated
Les modèles officiels Gemma 4 et Google AI Studio ne sont pas des chats NSFW sans limite. Les contenus adultes, dangereux, illégaux ou sensibles peuvent être refusés ou traités prudemment.
Les personnes qui étudient les refus peuvent trouver Gemma 4 26B-A4B Uncensored / Heretic et Gemma 4 31B Abliterated. Ce sont des modèles communautaires, pas des versions officielles Google.


Questions fréquentes
Quel Gemma 4 télécharger en premier ?
Avec un GPU courant, commencez par 12B ou une version quantifiée avant 26B-A4B ou 31B.
Un GPU 24 Go peut-il lancer 31B ?
En BF16 ce n’est pas réaliste ; seulement avec quantification et contexte court.
Les variantes uncensored sont-elles officielles ?
Non. Heretic et Abliterated sont des dérivés communautaires sur Hugging Face.
Conclusion
Gemma 4 convient aux utilisateurs qui veulent des poids ouverts Google, un long contexte, le multimodal et une documentation claire. Le plus sûr est de tester AI Studio ou 12B avant 26B-A4B ou 31B.