Test de Gemma 4 : installation locale, GPU et politique NSFW

Gemma 4 est la nouvelle famille de modèles open-weight de Google DeepMind pour les développeurs qui veulent tester un LLM local ou auto-hébergé dans l’écosystème…

schedule
article 5 min de lecture
Image de couverture du test de Gemma 4

Gemma 4 est la nouvelle famille de modèles open-weight de Google DeepMind pour les développeurs qui veulent tester un LLM local ou auto-hébergé dans l’écosystème Google. Elle comprend des variantes E2B, E4B, 12B, 26B-A4B et 31B.

Pour l’évaluer correctement, il faut distinguer les versions. Le 31B vise la qualité, le 26B-A4B cherche l’efficacité, et le 12B reste l’entrée la plus réaliste pour beaucoup de GPU grand public. Les modèles officiels sont alignés sur la sécurité, tandis que la communauté propose déjà des variantes uncensored et abliterated.

Qu’est-ce que Gemma 4 ?

Gemma 4 est une famille de modèles open-weight de Google DeepMind issue des recherches Gemini 3. La fiche officielle liste E2B, E4B, 12B, 26B-A4B et 31B, avec jusqu’à 256K de contexte, entrée texte et image, et audio sur certaines petites variantes.

Gemma 4 model card
La fiche officielle de Gemma 4 présente les tailles, modalités, longueur de contexte et notes de sécurité.

En pratique, E2B/E4B sont légers, 12B sert aux tests locaux, 26B-A4B vise l’efficacité active et 31B est la variante plus lourde orientée qualité.

Téléchargements officiels

Modèle Idéal pour Téléchargement
Gemma 4 31B IT Tests locaux orientés qualité Hugging Face 31B IT
Gemma 4 26B-A4B IT Efficacité et débit Hugging Face 26B-A4B IT
Gemma 4 12B IT Premier test sur GPU grand public Hugging Face 12B IT
Gemma 4 model card Spécifications et sécurité Google AI Developers
Gemma 4 31B IT
Gemma 4 31B IT est l’option dense orientée qualité.
Gemma 4 26B-A4B IT
Gemma 4 26B-A4B IT met l’accent sur l’efficacité des paramètres actifs.

Performances et ressenti d’usage

Le discours officiel met l’accent sur l’intelligence par paramètre, le long contexte, le multimodal et l’usage développeur. En pratique, il faut tester ses propres tâches : code, résumé long, RAG local, écriture mixte, extraction structurée et image peuvent changer le classement.

Gemma 4 12B IT
Gemma 4 12B IT est plus simple à tester sur un GPU grand public.

Comparaison avec les LLM locaux

Modèle Note
Gemma 4 Poids ouverts Google, long contexte, multimodal et documentation claire.
Qwen 3.8 Très fort en multilingue, code et tâches chinois/japonais/anglais.
Llama Écosystème immense de quantifications et fine-tunes.
DeepSeek Souvent comparé en raisonnement et code.
Mistral / Mixtral Écosystème mûr pour MoE et déploiements ouverts.

Installation locale

Pour un premier test local, Transformers suffit. Pour API, batching ou meilleur débit, regardez vLLM ou SGLang. Sur les grands modèles, vérifiez VRAM, quantification et contexte.

pip install -U transformers accelerate torch safetensors python - <<'PY' from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "google/gemma-4-12B-it" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="auto", device_map="auto") PY

Besoins GPU et matériel

Variante VRAM Note
Gemma 4 31B IT BF16 60GB+ / 80GB GPU preferred 24 Go demande 4-bit et contexte court.
Gemma 4 26B-A4B IT Large total weights Moins de paramètres actifs ne signifie pas poids légers.
Gemma 4 12B IT 16GB-24GB comfortable / lower with quantization Meilleur point d’entrée local.

Utilisation en ligne si le matériel ne suffit pas

Google AI Studio est la voie la plus directe sans GPU puissant : testez prompts, contexte et API avant de télécharger de gros poids.

Google AI Studio
Google AI Studio est la solution la plus simple si votre GPU local ne suffit pas.

NSFW, Uncensored et modèles Abliterated

Les modèles officiels Gemma 4 et Google AI Studio ne sont pas des chats NSFW sans limite. Les contenus adultes, dangereux, illégaux ou sensibles peuvent être refusés ou traités prudemment.

Les personnes qui étudient les refus peuvent trouver Gemma 4 26B-A4B Uncensored / Heretic et Gemma 4 31B Abliterated. Ce sont des modèles communautaires, pas des versions officielles Google.

Gemma 4 Heretic
Heretic est une variante uncensored communautaire, pas une version officielle de Google.
Gemma 4 Abliterated
La variante 31B abliterated vise à réduire le comportement de refus.

Questions fréquentes

Quel Gemma 4 télécharger en premier ?

Avec un GPU courant, commencez par 12B ou une version quantifiée avant 26B-A4B ou 31B.

Un GPU 24 Go peut-il lancer 31B ?

En BF16 ce n’est pas réaliste ; seulement avec quantification et contexte court.

Les variantes uncensored sont-elles officielles ?

Non. Heretic et Abliterated sont des dérivés communautaires sur Hugging Face.

Conclusion

Gemma 4 convient aux utilisateurs qui veulent des poids ouverts Google, un long contexte, le multimodal et une documentation claire. Le plus sûr est de tester AI Studio ou 12B avant 26B-A4B ou 31B.

Références

Se connecter

OU

Créer un compte

Le mot de passe doit contenir entre 8 et 20 caractères et inclure des lettres et des chiffres

OU

Mot de Passe Oublié

Le mot de passe doit contenir entre 8 et 20 caractères et inclure des lettres et des chiffres