Análisis de Llama 4: Scout, Maverick, Behemoth, despliegue local y política NSFW
Llama 4 es la generación con la que Meta llevó la familia Llama a una arquitectura MoE nativamente multimodal. La novedad no es un único…
Llama 4 es la generación con la que Meta llevó la familia Llama a una arquitectura MoE nativamente multimodal. La novedad no es un único modelo, sino tres piezas con funciones distintas: Scout para contexto extremo, Maverick para uso general multimodal y Behemoth como gran modelo maestro para destilación.
La lectura práctica es sencilla: Scout interesa si trabajas con documentos enormes, RAG o repositorios de código grandes; Maverick es más atractivo para asistentes con visión, programación y producto; Behemoth no es un modelo pensado para descarga local normal. En un PC de consumo, Llama 4 no es la opción más cómoda.
Índice
Veredicto rápido
| Punto | Resumen |
|---|---|
| Mejor para | Apps multimodales, RAG de contexto largo, asistentes de programación y despliegues privados |
| Scout | Contexto de hasta 10M tokens y menor presión de despliegue dentro de Llama 4 |
| Maverick | Mejor calidad general en chat, visión y código, pero más pesado |
| Behemoth | Modelo maestro, no una descarga local habitual |
| Online | Meta AI |
| Descarga | Descargas oficiales / Scout en Hugging Face / Maverick en Hugging Face |
| NSFW | Modelos oficiales alineados; sin modo NSFW oficial |
Qué es Llama 4

Meta anunció Llama 4 el 5 de abril de 2025. Scout y Maverick se publicaron como modelos open-weight, mientras que Behemoth se presentó como un modelo maestro mucho mayor. Frente a Llama 3, el salto está en la mezcla de expertos y en la multimodalidad nativa.
La multimodalidad nativa permite procesar texto e imágenes dentro de la misma arquitectura. Esto ayuda en capturas de pantalla, gráficos, documentos visuales, interfaces y preguntas sobre imágenes. MoE, por su parte, activa solo una parte de los expertos por token, combinando gran capacidad total con computación activa menor.
Scout, Maverick y Behemoth
| Modelo | Estado | Parámetros | Contexto | Uso principal |
|---|---|---|---|---|
| Llama 4 Scout | Open-weight | 17B activos / 109B totales / 16 expertos | 10M tokens | Documentos largos, repositorios grandes, RAG |
| Llama 4 Maverick | Open-weight | 17B activos / 400B totales / 128 expertos | 1M tokens | Chat, visión, código y apps multimodales |
| Llama 4 Behemoth | Vista previa maestro | 288B activos / casi 2T totales | No es descarga local normal | Destilación e investigación |
Scout destaca por su ventana de contexto. Puede ser muy útil para leer bases documentales enormes, pero el resultado real depende de la infraestructura, la estrategia de recuperación y la calidad del prompt.
Maverick apunta a mejor calidad general. Su tamaño total y número de expertos lo hacen más adecuado para inferencia alojada o servidores potentes que para un equipo doméstico.
Uso online y descargas
La forma más rápida de probarlo es Meta AI. Para desarrolladores, el punto de partida es llama.com y los repositorios Llama 4 Scout y Llama 4 Maverick. Antes de usarlo en un producto comercial conviene revisar la licencia y la política de uso.
Despliegue local y hardware
Meta indica que Scout puede caber en una GPU NVIDIA H100 con cuantización Int4. Maverick exige una infraestructura más cercana a servidores H100 DGX o despliegues distribuidos. Por eso no debe confundirse con un modelo local ligero de 7B, 14B o 27B.
| Hardware | Recomendación |
|---|---|
| 8GB-16GB VRAM | Usar modelos más pequeños como Qwen, Gemma, Mistral o Llama 3.x cuantizado |
| 24GB VRAM | Insuficiente para Llama 4 completo |
| H100 | Scout puede ser viable con optimización |
| Servidor multi-GPU | Ruta más lógica para Maverick |
| API alojada | La forma más práctica de evaluar el modelo |
Rendimiento y experiencia real
Las cifras oficiales colocan a Llama 4 como una familia muy competitiva, especialmente por contexto largo, visión y eficiencia MoE. Sin embargo, los resultados de Maverick en benchmarks generaron debate porque algunas clasificaciones usaban una variante experimental distinta de la versión pública.
La conclusión sensata es probar el modelo exacto que vas a usar. En tareas reales importan el proveedor, la latencia, el soporte de imágenes, la memoria de contexto y la integración con herramientas tanto como el nombre del modelo.
Comparativa con otros LLM abiertos
| Modelo | Punto fuerte | Límite | Ideal para |
|---|---|---|---|
| Llama 4 Scout | Contexto extremo y multimodalidad | Hardware alto | RAG largo y lectura de código |
| Llama 4 Maverick | Asistente multimodal más potente | Coste de despliegue | Productos alojados |
| Qwen 3.8 | Ecosistema local práctico | Menos contexto extremo | Usuarios locales |
| Gemma 4 | Eficiencia y respaldo de Google | No centrado en NSFW oficial | Asistente local general |
| Dolphin 3 | Ruta uncensored clásica | Menos frontier multimodal | Roleplay y escritura libre |
| Kimi K3 | MoE enorme y contexto largo | Infraestructura empresarial | Agentes y RAG corporativo |
NSFW y límites de seguridad
Llama 4 no es un modelo NSFW-first. Meta AI y los modelos instruct oficiales están alineados con políticas de seguridad. El contenido sexual explícito, menores, sexualización de personas reales o instrucciones ilegales pueden ser rechazados.
Los pesos abiertos dan más control en un despliegue propio, pero no equivalen a un modo uncensored oficial. Si la prioridad es roleplay adulto o menos negativas, modelos como Dolphin o fine-tunes comunitarios son más directos.
Comunidad y ecosistema
Llama tiene uno de los ecosistemas más fuertes: proveedores cloud, runtimes, herramientas de fine-tuning, RAG, evaluación y seguridad. Aun así, Llama 4 es más complejo que un dense LLM tradicional. Antes de adoptar una versión cuantizada, hay que comprobar si mantiene entrada de imágenes, contexto largo y comportamiento del modelo original.
Preguntas frecuentes
¿Llama 4 es gratis?
Scout y Maverick se distribuyen bajo la licencia comunitaria de Llama 4. Puede servir para muchos usos, pero no es una licencia sin condiciones.
¿Puedo ejecutarlo en mi PC?
No de forma cómoda. Scout requiere hardware de clase H100 para una evaluación seria; Maverick es más de servidor.
¿Scout o Maverick?
Scout para contexto enorme; Maverick para mejor asistente multimodal general.
¿Soporta imágenes?
Sí. Scout y Maverick aceptan texto e imágenes como entrada.
¿Es uncensored?
No. Los modelos oficiales tienen alineación de seguridad.
Referencias
- Meta Llama 4 official announcement
- Llama 4 Scout on Hugging Face
- Llama 4 Maverick on Hugging Face
- Official Llama downloads
- Llama 4 Community License
- Llama 4 acceptable use policy
- TechCrunch benchmark report
- TechCrunch Maverick follow-up
Conclusión
Llama 4 es importante porque combina pesos abiertos, multimodalidad nativa y MoE a escala seria. Scout abre una vía interesante para contexto extremo y Maverick para productos multimodales alojados.
Pero no es automáticamente la mejor opción para todos. Para hardware local modesto conviene comparar con Qwen, Gemma, Mistral o Llama 3.x. Para NSFW, hay alternativas comunitarias más específicas. La decisión correcta nace de probar el modelo con tus propios documentos, imágenes, código y presupuesto.