Review de Gemma 4: instalación local, requisitos de GPU y política NSFW

Gemma 4 es la familia de modelos open-weight más reciente de Google DeepMind para desarrolladores que quieren probar un LLM local o autoalojado dentro del…

schedule
article 4 min de lectura
Imagen destacada del review de Gemma 4

Gemma 4 es la familia de modelos open-weight más reciente de Google DeepMind para desarrolladores que quieren probar un LLM local o autoalojado dentro del ecosistema de Google. No es un solo modelo: incluye opciones E2B, E4B, 12B, 26B-A4B y 31B.

Para evaluar Gemma 4 conviene separar calidad, coste local, GPU y política NSFW. El 31B apunta a calidad, el 26B-A4B busca eficiencia y el 12B es el punto de entrada más realista. Los modelos oficiales están alineados con seguridad, mientras que Hugging Face ya tiene variantes uncensored y abliterated de la comunidad.

Qué es Gemma 4

Gemma 4 es una familia de modelos abiertos de Google DeepMind basada en investigación de Gemini 3. La ficha oficial enumera E2B, E4B, 12B, 26B-A4B y 31B, con contexto de hasta 256K, entrada de texto e imagen y audio en algunas variantes pequeñas.

Gemma 4 model card
La ficha oficial de Gemma 4 muestra tamaños, modalidades, contexto y notas de seguridad.

En términos prácticos, E2B/E4B son ligeros, 12B sirve para pruebas locales, 26B-A4B destaca por eficiencia activa y 31B es la opción pesada orientada a calidad.

Descargas oficiales

Modelo Mejor para Descarga
Gemma 4 31B IT Calidad y pruebas locales exigentes Hugging Face 31B IT
Gemma 4 26B-A4B IT Eficiencia y pruebas de throughput Hugging Face 26B-A4B IT
Gemma 4 12B IT Primera prueba en GPU de consumo Hugging Face 12B IT
Gemma 4 model card Especificaciones y seguridad Google AI Developers
Gemma 4 31B IT
Gemma 4 31B IT es la opción densa para pruebas centradas en calidad.
Gemma 4 26B-A4B IT
Gemma 4 26B-A4B IT busca un mejor equilibrio entre capacidad y coste activo.

Rendimiento y experiencia real

La comunicación oficial insiste en inteligencia por parámetro, contexto largo, entrada multimodal y facilidad para desarrolladores. En la práctica, conviene probar tareas propias: código, resumen largo, RAG local, escritura mixta, extracción estructurada e imagen pueden cambiar el ranking.

Gemma 4 12B IT
Gemma 4 12B IT es más fácil de probar en una GPU de consumo.

Comparación con LLM locales

Modelo Nota
Gemma 4 Pesos abiertos de Google, contexto largo, multimodal y documentación clara.
Qwen 3.8 Muy fuerte en multilingüe, código y tareas chino/japonés/inglés.
Llama Ecosistema enorme de cuantizaciones y fine-tunes.
DeepSeek Muy comparado en razonamiento y código.
Mistral / Mixtral Ecosistema maduro para MoE y despliegues abiertos.

Instalación local

Para una primera prueba local, Transformers es suficiente. Para API, batching o más throughput, revisa vLLM o SGLang. En modelos grandes, confirma VRAM, cuantización y contexto.

pip install -U transformers accelerate torch safetensors python - <<'PY' from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "google/gemma-4-12B-it" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="auto", device_map="auto") PY

Requisitos de GPU y hardware

Variante VRAM Nota
Gemma 4 31B IT BF16 60GB+ / 80GB GPU preferred 24GB exige 4-bit y contexto corto.
Gemma 4 26B-A4B IT Large total weights Menos parámetros activos no significa pesos pequeños.
Gemma 4 12B IT 16GB-24GB comfortable / lower with quantization Mejor punto de partida local.

Uso online si tu hardware no alcanza

Google AI Studio es la ruta más directa si tu hardware no alcanza: prueba prompts, contexto y API antes de descargar pesos grandes.

Google AI Studio
Google AI Studio es la vía más sencilla cuando tu GPU local no es suficiente.

NSFW, Uncensored y modelos Abliterated

Los modelos oficiales Gemma 4 y Google AI Studio no son servicios NSFW sin límites. Contenido adulto, peligroso, ilegal o sensible puede ser rechazado o respondido con cautela.

Quien investigue el comportamiento de rechazo puede encontrar Gemma 4 26B-A4B Uncensored / Heretic y Gemma 4 31B Abliterated. Son modelos de la comunidad, no versiones oficiales de Google.

Gemma 4 Heretic
Heretic es una variante uncensored de la comunidad, no una versión oficial de Google.
Gemma 4 Abliterated
La variante 31B abliterated busca reducir el comportamiento de rechazo.

Preguntas frecuentes

¿Qué Gemma 4 conviene descargar primero?

Con una GPU común, empieza por 12B o una versión cuantizada antes de pasar a 26B-A4B o 31B.

¿Una GPU de 24 GB puede ejecutar 31B?

En BF16 no es realista; solo con cuantización y contexto corto.

¿Las variantes uncensored son oficiales?

No. Heretic y Abliterated son derivados de la comunidad en Hugging Face.

Conclusión

Gemma 4 encaja con quien busca pesos abiertos de Google, contexto largo, multimodalidad y documentación clara. Lo más prudente es probar AI Studio o 12B antes de desplegar 26B-A4B o 31B.

Referencias

Etiquetas de reseña

#Gemma #Gemma 4 #IA local #LLM #NSFW

Iniciar sesión

O

Crear cuenta

La contraseña debe tener entre 8 y 20 caracteres y contener letras y números

O

Olvidé mi Contraseña

La contraseña debe tener entre 8 y 20 caracteres y contener letras y números