Review do Llama 4: Scout, Maverick, Behemoth, uso local e política NSFW

O Llama 4 marca a entrada da família Llama em uma geração nativamente multimodal e baseada em Mixture-of-Experts. A linha inclui Scout, voltado a contexto…

schedule
article 5 min de leitura
Capa do review do Llama 4 com Scout, Maverick e NSFW

O Llama 4 marca a entrada da família Llama em uma geração nativamente multimodal e baseada em Mixture-of-Experts. A linha inclui Scout, voltado a contexto extremamente longo; Maverick, mais forte como assistente multimodal geral; e Behemoth, um modelo professor de escala muito maior.

Na prática, Scout faz sentido para documentos extensos, RAG e grandes bases de código. Maverick é melhor para chat, visão, programação e aplicações multimodais hospedadas. Behemoth não é um modelo comum para baixar e rodar localmente. Para quem tem apenas uma GPU doméstica, modelos menores ainda são mais realistas.

Veredito rápido

Item Resumo
Melhor para Apps multimodais, RAG com contexto longo, assistentes de código e implantação privada
Scout Contexto de 10M tokens e implantação relativamente mais viável
Maverick Qualidade geral melhor em chat, visão e código, mas exige mais infraestrutura
Behemoth Modelo professor, não voltado a uso local comum
Online Meta AI
Download Downloads oficiais / Scout no Hugging Face / Maverick no Hugging Face
NSFW Serviços oficiais são alinhados por segurança; não há modo NSFW oficial

O que é Llama 4

Captura da página oficial do Meta Llama 4
A página oficial da Meta apresenta Scout, Maverick e Behemoth na família Llama 4.

A Meta anunciou o Llama 4 em 5 de abril de 2025. Scout e Maverick foram disponibilizados como modelos open-weight, enquanto Behemoth aparece como um modelo professor usado para elevar a qualidade da família.

A multimodalidade nativa permite entender texto e imagem no mesmo backbone, o que ajuda em capturas de tela, gráficos, documentos visuais e interfaces. O MoE ativa apenas alguns especialistas por token, reduzindo o cálculo ativo sem abrir mão de grande capacidade total.

Scout, Maverick e Behemoth

Modelo Status Parâmetros Contexto Uso
Llama 4 Scout Open-weight 17B ativos / 109B totais / 16 especialistas 10M tokens Documentos longos, RAG, bases de código
Llama 4 Maverick Open-weight 17B ativos / 400B totais / 128 especialistas 1M tokens Chat, visão, código e apps multimodais
Llama 4 Behemoth Professor em preview 288B ativos / quase 2T totais Não é download local normal Destilação e pesquisa

O Scout chama atenção pelo contexto de 10M tokens. Isso pode ajudar em projetos com muitos documentos, mas a qualidade real depende do runtime, memória, recuperação de contexto e prompt.

O Maverick é mais ambicioso como assistente geral. Ele tende a ser a melhor escolha quando a aplicação precisa combinar imagem, texto e código, desde que a infraestrutura esteja disponível.

Uso online e downloads

A maneira mais simples de testar é pelo Meta AI. Desenvolvedores devem começar pela página de downloads oficiais do Llama e pelos repositórios Llama 4 Scout e Llama 4 Maverick. Para uso comercial, revise a licença e a política de uso aceitável.

Uso local e hardware

A Meta afirma que o Scout pode caber em uma NVIDIA H100 com quantização Int4. O Maverick fica mais próximo de um servidor H100 DGX ou inferência distribuída. Portanto, não é um modelo para rodar confortavelmente em placas de vídeo comuns.

Hardware Expectativa
8GB-16GB VRAM Prefira modelos menores e quantizados
24GB VRAM Ainda insuficiente para Llama 4 completo
H100 Scout pode ser testado com otimização
Servidor multi-GPU Caminho mais realista para Maverick
API hospedada Melhor início para a maioria dos times

Desempenho e experiência real

Os materiais oficiais destacam contexto longo, multimodalidade e eficiência. Ao mesmo tempo, a comunidade e a imprensa foram mais cautelosas com alguns benchmarks do Maverick, porque versões experimentais e públicas não eram necessariamente idênticas.

Por isso, a avaliação correta deve usar o modelo exato, o provedor exato e tarefas reais: seus documentos, imagens, código, latência e custo.

Comparação com outros LLMs abertos

Modelo Força Limite Indicado para
Llama 4 Scout Contexto extremo e multimodalidade Hardware alto RAG e leitura de código
Llama 4 Maverick Assistente multimodal forte Custo de implantação Produtos hospedados
Qwen 3.8 Ecossistema local prático Contexto menos extremo Uso local realista
Gemma 4 Eficiência e ecossistema Google Não é NSFW oficial Assistente geral
Dolphin 3 Rota uncensored clássica Menos forte em multimodalidade Roleplay e escrita livre
Kimi K3 MoE enorme e contexto longo Infraestrutura empresarial Agentes e RAG corporativo

NSFW e limites de segurança

O Llama 4 não é um modelo focado em NSFW. O Meta AI e os modelos instruct oficiais têm alinhamento de segurança, com restrições para conteúdo sexual explícito, menores, sexualização de pessoas reais e instruções ilegais.

Pesos abertos dão controle em uma implantação própria, mas isso não equivale a um modo uncensored oficial. Para roleplay adulto ou menor taxa de recusa, modelos comunitários específicos costumam ser mais diretos.

Comunidade e ecossistema

A força do Llama está no ecossistema: provedores cloud, runtimes, fine-tuning, RAG, avaliação e ferramentas de segurança. No Llama 4, porém, MoE e multimodalidade tornam o suporte mais complexo. Confira sempre se versões quantizadas preservam entrada de imagem e contexto longo.

Perguntas frequentes

O Llama 4 é gratuito?

Scout e Maverick usam a Llama 4 Community License. Muitos usos são possíveis, mas a licença tem condições.

Dá para rodar localmente?

Scout é o mais viável, mas ainda requer hardware de classe H100 para uso sério.

Scout ou Maverick?

Scout para contexto enorme; Maverick para qualidade multimodal geral.

Ele entende imagens?

Sim, Scout e Maverick aceitam texto e imagens como entrada.

É uncensored?

Não. Os modelos oficiais têm alinhamento de segurança.

Referências

Conclusão

O Llama 4 é uma evolução importante por juntar open weights, multimodalidade nativa e MoE. Scout é atraente para contexto extremo; Maverick é melhor para aplicações multimodais mais completas.

Mesmo assim, ele não substitui todos os modelos locais. Para hardware modesto, Qwen, Gemma, Mistral ou Llama 3.x podem ser melhores. Para NSFW, modelos comunitários dedicados tendem a ser mais adequados.

Tags de Avaliação

#IA local #IA multimodal #Llama 4 #LLM open-weight #Meta AI #MoE #NSFW

Entrar

OU

Criar conta

A senha deve ter entre 8 e 20 caracteres e conter letras e números

OU

Esqueceu a Senha

A senha deve ter entre 8 e 20 caracteres e conter letras e números