Análisis de Llama 4: Scout, Maverick, Behemoth, despliegue local y política NSFW

Llama 4 es la generación con la que Meta llevó la familia Llama a una arquitectura MoE nativamente multimodal. La novedad no es un único…

schedule
article 6 min de lectura
Portada del análisis de Llama 4 con Scout, Maverick y NSFW

Llama 4 es la generación con la que Meta llevó la familia Llama a una arquitectura MoE nativamente multimodal. La novedad no es un único modelo, sino tres piezas con funciones distintas: Scout para contexto extremo, Maverick para uso general multimodal y Behemoth como gran modelo maestro para destilación.

La lectura práctica es sencilla: Scout interesa si trabajas con documentos enormes, RAG o repositorios de código grandes; Maverick es más atractivo para asistentes con visión, programación y producto; Behemoth no es un modelo pensado para descarga local normal. En un PC de consumo, Llama 4 no es la opción más cómoda.

Veredicto rápido

Punto Resumen
Mejor para Apps multimodales, RAG de contexto largo, asistentes de programación y despliegues privados
Scout Contexto de hasta 10M tokens y menor presión de despliegue dentro de Llama 4
Maverick Mejor calidad general en chat, visión y código, pero más pesado
Behemoth Modelo maestro, no una descarga local habitual
Online Meta AI
Descarga Descargas oficiales / Scout en Hugging Face / Maverick en Hugging Face
NSFW Modelos oficiales alineados; sin modo NSFW oficial

Qué es Llama 4

Captura de la página oficial de Meta Llama 4
La página oficial de Meta presenta Scout, Maverick y Behemoth dentro de la familia Llama 4.

Meta anunció Llama 4 el 5 de abril de 2025. Scout y Maverick se publicaron como modelos open-weight, mientras que Behemoth se presentó como un modelo maestro mucho mayor. Frente a Llama 3, el salto está en la mezcla de expertos y en la multimodalidad nativa.

La multimodalidad nativa permite procesar texto e imágenes dentro de la misma arquitectura. Esto ayuda en capturas de pantalla, gráficos, documentos visuales, interfaces y preguntas sobre imágenes. MoE, por su parte, activa solo una parte de los expertos por token, combinando gran capacidad total con computación activa menor.

Scout, Maverick y Behemoth

Modelo Estado Parámetros Contexto Uso principal
Llama 4 Scout Open-weight 17B activos / 109B totales / 16 expertos 10M tokens Documentos largos, repositorios grandes, RAG
Llama 4 Maverick Open-weight 17B activos / 400B totales / 128 expertos 1M tokens Chat, visión, código y apps multimodales
Llama 4 Behemoth Vista previa maestro 288B activos / casi 2T totales No es descarga local normal Destilación e investigación

Scout destaca por su ventana de contexto. Puede ser muy útil para leer bases documentales enormes, pero el resultado real depende de la infraestructura, la estrategia de recuperación y la calidad del prompt.

Maverick apunta a mejor calidad general. Su tamaño total y número de expertos lo hacen más adecuado para inferencia alojada o servidores potentes que para un equipo doméstico.

Uso online y descargas

La forma más rápida de probarlo es Meta AI. Para desarrolladores, el punto de partida es llama.com y los repositorios Llama 4 Scout y Llama 4 Maverick. Antes de usarlo en un producto comercial conviene revisar la licencia y la política de uso.

Despliegue local y hardware

Meta indica que Scout puede caber en una GPU NVIDIA H100 con cuantización Int4. Maverick exige una infraestructura más cercana a servidores H100 DGX o despliegues distribuidos. Por eso no debe confundirse con un modelo local ligero de 7B, 14B o 27B.

Hardware Recomendación
8GB-16GB VRAM Usar modelos más pequeños como Qwen, Gemma, Mistral o Llama 3.x cuantizado
24GB VRAM Insuficiente para Llama 4 completo
H100 Scout puede ser viable con optimización
Servidor multi-GPU Ruta más lógica para Maverick
API alojada La forma más práctica de evaluar el modelo

Rendimiento y experiencia real

Las cifras oficiales colocan a Llama 4 como una familia muy competitiva, especialmente por contexto largo, visión y eficiencia MoE. Sin embargo, los resultados de Maverick en benchmarks generaron debate porque algunas clasificaciones usaban una variante experimental distinta de la versión pública.

La conclusión sensata es probar el modelo exacto que vas a usar. En tareas reales importan el proveedor, la latencia, el soporte de imágenes, la memoria de contexto y la integración con herramientas tanto como el nombre del modelo.

Comparativa con otros LLM abiertos

Modelo Punto fuerte Límite Ideal para
Llama 4 Scout Contexto extremo y multimodalidad Hardware alto RAG largo y lectura de código
Llama 4 Maverick Asistente multimodal más potente Coste de despliegue Productos alojados
Qwen 3.8 Ecosistema local práctico Menos contexto extremo Usuarios locales
Gemma 4 Eficiencia y respaldo de Google No centrado en NSFW oficial Asistente local general
Dolphin 3 Ruta uncensored clásica Menos frontier multimodal Roleplay y escritura libre
Kimi K3 MoE enorme y contexto largo Infraestructura empresarial Agentes y RAG corporativo

NSFW y límites de seguridad

Llama 4 no es un modelo NSFW-first. Meta AI y los modelos instruct oficiales están alineados con políticas de seguridad. El contenido sexual explícito, menores, sexualización de personas reales o instrucciones ilegales pueden ser rechazados.

Los pesos abiertos dan más control en un despliegue propio, pero no equivalen a un modo uncensored oficial. Si la prioridad es roleplay adulto o menos negativas, modelos como Dolphin o fine-tunes comunitarios son más directos.

Comunidad y ecosistema

Llama tiene uno de los ecosistemas más fuertes: proveedores cloud, runtimes, herramientas de fine-tuning, RAG, evaluación y seguridad. Aun así, Llama 4 es más complejo que un dense LLM tradicional. Antes de adoptar una versión cuantizada, hay que comprobar si mantiene entrada de imágenes, contexto largo y comportamiento del modelo original.

Preguntas frecuentes

¿Llama 4 es gratis?

Scout y Maverick se distribuyen bajo la licencia comunitaria de Llama 4. Puede servir para muchos usos, pero no es una licencia sin condiciones.

¿Puedo ejecutarlo en mi PC?

No de forma cómoda. Scout requiere hardware de clase H100 para una evaluación seria; Maverick es más de servidor.

¿Scout o Maverick?

Scout para contexto enorme; Maverick para mejor asistente multimodal general.

¿Soporta imágenes?

Sí. Scout y Maverick aceptan texto e imágenes como entrada.

¿Es uncensored?

No. Los modelos oficiales tienen alineación de seguridad.

Referencias

Conclusión

Llama 4 es importante porque combina pesos abiertos, multimodalidad nativa y MoE a escala seria. Scout abre una vía interesante para contexto extremo y Maverick para productos multimodales alojados.

Pero no es automáticamente la mejor opción para todos. Para hardware local modesto conviene comparar con Qwen, Gemma, Mistral o Llama 3.x. Para NSFW, hay alternativas comunitarias más específicas. La decisión correcta nace de probar el modelo con tus propios documentos, imágenes, código y presupuesto.

Etiquetas de reseña

#IA local #IA multimodal #Llama 4 #LLM open-weight #Meta AI #MoE #NSFW

Iniciar sesión

O

Crear cuenta

La contraseña debe tener entre 8 y 20 caracteres y contener letras y números

O

Olvidé mi Contraseña

La contraseña debe tener entre 8 y 20 caracteres y contener letras y números