Review do Gemma 4: instalação local, GPU e política NSFW
Gemma 4 é a família open-weight mais recente do Google DeepMind para quem quer testar um LLM local ou auto-hospedado ligado ao ecossistema do Google….
Gemma 4 é a família open-weight mais recente do Google DeepMind para quem quer testar um LLM local ou auto-hospedado ligado ao ecossistema do Google. Ela inclui modelos E2B, E4B, 12B, 26B-A4B e 31B.
Na prática, é melhor avaliar Gemma 4 por versão. O 31B mira qualidade, o 26B-A4B tenta equilibrar capacidade e eficiência, e o 12B é a porta de entrada mais realista. Os modelos oficiais são alinhados para segurança, mas já existem variantes uncensored e abliterated da comunidade no Hugging Face.
Índice
O que é Gemma 4
Gemma 4 é uma família de modelos open-weight do Google DeepMind baseada em pesquisa do Gemini 3. O model card oficial lista E2B, E4B, 12B, 26B-A4B e 31B, com contexto de até 256K, entrada de texto e imagem e áudio em algumas versões menores.

Na prática, E2B/E4B são leves, 12B serve para testes locais, 26B-A4B destaca eficiência ativa e 31B é a opção pesada voltada para qualidade.
Downloads oficiais
| Modelo | Melhor para | Download |
|---|---|---|
| Gemma 4 31B IT | Qualidade e testes locais exigentes | Hugging Face 31B IT |
| Gemma 4 26B-A4B IT | Eficiência e throughput | Hugging Face 26B-A4B IT |
| Gemma 4 12B IT | Primeiro teste em GPU comum | Hugging Face 12B IT |
| Gemma 4 model card | Especificações e segurança | Google AI Developers |


Desempenho e experiência prática
A comunicação oficial enfatiza inteligência por parâmetro, contexto longo, entrada multimodal e facilidade para desenvolvedores. Na prática, teste tarefas próprias: código, resumo longo, RAG local, escrita mista, extração estruturada e imagem podem mudar o ranking.

Comparação com LLMs locais
| Modelo | Nota |
|---|---|
| Gemma 4 | Pesos abertos do Google, contexto longo, multimodal e documentação clara. |
| Qwen 3.8 | Muito forte em multilingue, código e tarefas chinês/japonês/inglês. |
| Llama | Ecossistema enorme de quantizações e fine-tunes. |
| DeepSeek | Muito comparado em raciocínio e código. |
| Mistral / Mixtral | Ecossistema maduro para MoE e deploys abertos. |
Instalação local
Para o primeiro teste local, Transformers basta. Para API, batching ou maior throughput, veja vLLM ou SGLang. Em modelos grandes, confirme VRAM, quantização e contexto.
pip install -U transformers accelerate torch safetensors python - <<'PY' from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "google/gemma-4-12B-it" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="auto", device_map="auto") PY Requisitos de GPU e hardware
| Variante | VRAM | Nota |
|---|---|---|
| Gemma 4 31B IT | BF16 60GB+ / 80GB GPU preferred | 24GB exige 4-bit e contexto curto. |
| Gemma 4 26B-A4B IT | Large total weights | Menos parâmetros ativos não significa pesos pequenos. |
| Gemma 4 12B IT | 16GB-24GB comfortable / lower with quantization | Melhor ponto de partida local. |
Uso online quando o hardware não basta
Google AI Studio é a rota mais direta se o hardware não basta: teste prompts, contexto e API antes de baixar pesos grandes.

NSFW, Uncensored e modelos Abliterated
Os modelos oficiais Gemma 4 e o Google AI Studio não são serviços NSFW sem limites. Conteúdo adulto, perigoso, ilegal ou sensível pode ser recusado ou tratado com cautela.
Quem pesquisa comportamento de recusa pode encontrar Gemma 4 26B-A4B Uncensored / Heretic e Gemma 4 31B Abliterated. São modelos da comunidade, não versões oficiais do Google.


Perguntas frequentes
Qual Gemma 4 baixar primeiro?
Com uma GPU comum, comece pelo 12B ou por uma versão quantizada antes de 26B-A4B ou 31B.
Uma GPU de 24 GB roda o 31B?
Em BF16 não é realista; só com quantização e contexto curto.
As variantes uncensored são oficiais?
Não. Heretic e Abliterated são derivados da comunidade no Hugging Face.
Conclusão
Gemma 4 combina com quem busca pesos abertos do Google, contexto longo, multimodalidade e documentação clara. O caminho mais seguro é testar AI Studio ou 12B antes de implantar 26B-A4B ou 31B.