Review do Gemma 4: instalação local, GPU e política NSFW

Gemma 4 é a família open-weight mais recente do Google DeepMind para quem quer testar um LLM local ou auto-hospedado ligado ao ecossistema do Google….

schedule
article 4 min de leitura
Imagem de capa do review do Gemma 4

Gemma 4 é a família open-weight mais recente do Google DeepMind para quem quer testar um LLM local ou auto-hospedado ligado ao ecossistema do Google. Ela inclui modelos E2B, E4B, 12B, 26B-A4B e 31B.

Na prática, é melhor avaliar Gemma 4 por versão. O 31B mira qualidade, o 26B-A4B tenta equilibrar capacidade e eficiência, e o 12B é a porta de entrada mais realista. Os modelos oficiais são alinhados para segurança, mas já existem variantes uncensored e abliterated da comunidade no Hugging Face.

O que é Gemma 4

Gemma 4 é uma família de modelos open-weight do Google DeepMind baseada em pesquisa do Gemini 3. O model card oficial lista E2B, E4B, 12B, 26B-A4B e 31B, com contexto de até 256K, entrada de texto e imagem e áudio em algumas versões menores.

Gemma 4 model card
O model card oficial do Gemma 4 mostra tamanhos, modalidades, contexto e notas de segurança.

Na prática, E2B/E4B são leves, 12B serve para testes locais, 26B-A4B destaca eficiência ativa e 31B é a opção pesada voltada para qualidade.

Downloads oficiais

Modelo Melhor para Download
Gemma 4 31B IT Qualidade e testes locais exigentes Hugging Face 31B IT
Gemma 4 26B-A4B IT Eficiência e throughput Hugging Face 26B-A4B IT
Gemma 4 12B IT Primeiro teste em GPU comum Hugging Face 12B IT
Gemma 4 model card Especificações e segurança Google AI Developers
Gemma 4 31B IT
Gemma 4 31B IT é a opção densa para testes focados em qualidade.
Gemma 4 26B-A4B IT
Gemma 4 26B-A4B IT destaca eficiência de parâmetros ativos.

Desempenho e experiência prática

A comunicação oficial enfatiza inteligência por parâmetro, contexto longo, entrada multimodal e facilidade para desenvolvedores. Na prática, teste tarefas próprias: código, resumo longo, RAG local, escrita mista, extração estruturada e imagem podem mudar o ranking.

Gemma 4 12B IT
Gemma 4 12B IT é mais fácil de testar em uma GPU comum.

Comparação com LLMs locais

Modelo Nota
Gemma 4 Pesos abertos do Google, contexto longo, multimodal e documentação clara.
Qwen 3.8 Muito forte em multilingue, código e tarefas chinês/japonês/inglês.
Llama Ecossistema enorme de quantizações e fine-tunes.
DeepSeek Muito comparado em raciocínio e código.
Mistral / Mixtral Ecossistema maduro para MoE e deploys abertos.

Instalação local

Para o primeiro teste local, Transformers basta. Para API, batching ou maior throughput, veja vLLM ou SGLang. Em modelos grandes, confirme VRAM, quantização e contexto.

pip install -U transformers accelerate torch safetensors python - <<'PY' from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "google/gemma-4-12B-it" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="auto", device_map="auto") PY

Requisitos de GPU e hardware

Variante VRAM Nota
Gemma 4 31B IT BF16 60GB+ / 80GB GPU preferred 24GB exige 4-bit e contexto curto.
Gemma 4 26B-A4B IT Large total weights Menos parâmetros ativos não significa pesos pequenos.
Gemma 4 12B IT 16GB-24GB comfortable / lower with quantization Melhor ponto de partida local.

Uso online quando o hardware não basta

Google AI Studio é a rota mais direta se o hardware não basta: teste prompts, contexto e API antes de baixar pesos grandes.

Google AI Studio
Google AI Studio é a rota mais simples quando a GPU local não é suficiente.

NSFW, Uncensored e modelos Abliterated

Os modelos oficiais Gemma 4 e o Google AI Studio não são serviços NSFW sem limites. Conteúdo adulto, perigoso, ilegal ou sensível pode ser recusado ou tratado com cautela.

Quem pesquisa comportamento de recusa pode encontrar Gemma 4 26B-A4B Uncensored / Heretic e Gemma 4 31B Abliterated. São modelos da comunidade, não versões oficiais do Google.

Gemma 4 Heretic
Heretic é uma variante uncensored da comunidade, não uma versão oficial do Google.
Gemma 4 Abliterated
A variante 31B abliterated busca reduzir respostas de recusa.

Perguntas frequentes

Qual Gemma 4 baixar primeiro?

Com uma GPU comum, comece pelo 12B ou por uma versão quantizada antes de 26B-A4B ou 31B.

Uma GPU de 24 GB roda o 31B?

Em BF16 não é realista; só com quantização e contexto curto.

As variantes uncensored são oficiais?

Não. Heretic e Abliterated são derivados da comunidade no Hugging Face.

Conclusão

Gemma 4 combina com quem busca pesos abertos do Google, contexto longo, multimodalidade e documentação clara. O caminho mais seguro é testar AI Studio ou 12B antes de implantar 26B-A4B ou 31B.

Referências

Entrar

OU

Criar conta

A senha deve ter entre 8 e 20 caracteres e conter letras e números

OU

Esqueceu a Senha

A senha deve ter entre 8 e 20 caracteres e conter letras e números