Review do Llama 4: Scout, Maverick, Behemoth, uso local e política NSFW
O Llama 4 marca a entrada da família Llama em uma geração nativamente multimodal e baseada em Mixture-of-Experts. A linha inclui Scout, voltado a contexto…
O Llama 4 marca a entrada da família Llama em uma geração nativamente multimodal e baseada em Mixture-of-Experts. A linha inclui Scout, voltado a contexto extremamente longo; Maverick, mais forte como assistente multimodal geral; e Behemoth, um modelo professor de escala muito maior.
Na prática, Scout faz sentido para documentos extensos, RAG e grandes bases de código. Maverick é melhor para chat, visão, programação e aplicações multimodais hospedadas. Behemoth não é um modelo comum para baixar e rodar localmente. Para quem tem apenas uma GPU doméstica, modelos menores ainda são mais realistas.
Índice
Veredito rápido
| Item | Resumo |
|---|---|
| Melhor para | Apps multimodais, RAG com contexto longo, assistentes de código e implantação privada |
| Scout | Contexto de 10M tokens e implantação relativamente mais viável |
| Maverick | Qualidade geral melhor em chat, visão e código, mas exige mais infraestrutura |
| Behemoth | Modelo professor, não voltado a uso local comum |
| Online | Meta AI |
| Download | Downloads oficiais / Scout no Hugging Face / Maverick no Hugging Face |
| NSFW | Serviços oficiais são alinhados por segurança; não há modo NSFW oficial |
O que é Llama 4

A Meta anunciou o Llama 4 em 5 de abril de 2025. Scout e Maverick foram disponibilizados como modelos open-weight, enquanto Behemoth aparece como um modelo professor usado para elevar a qualidade da família.
A multimodalidade nativa permite entender texto e imagem no mesmo backbone, o que ajuda em capturas de tela, gráficos, documentos visuais e interfaces. O MoE ativa apenas alguns especialistas por token, reduzindo o cálculo ativo sem abrir mão de grande capacidade total.
Scout, Maverick e Behemoth
| Modelo | Status | Parâmetros | Contexto | Uso |
|---|---|---|---|---|
| Llama 4 Scout | Open-weight | 17B ativos / 109B totais / 16 especialistas | 10M tokens | Documentos longos, RAG, bases de código |
| Llama 4 Maverick | Open-weight | 17B ativos / 400B totais / 128 especialistas | 1M tokens | Chat, visão, código e apps multimodais |
| Llama 4 Behemoth | Professor em preview | 288B ativos / quase 2T totais | Não é download local normal | Destilação e pesquisa |
O Scout chama atenção pelo contexto de 10M tokens. Isso pode ajudar em projetos com muitos documentos, mas a qualidade real depende do runtime, memória, recuperação de contexto e prompt.
O Maverick é mais ambicioso como assistente geral. Ele tende a ser a melhor escolha quando a aplicação precisa combinar imagem, texto e código, desde que a infraestrutura esteja disponível.
Uso online e downloads
A maneira mais simples de testar é pelo Meta AI. Desenvolvedores devem começar pela página de downloads oficiais do Llama e pelos repositórios Llama 4 Scout e Llama 4 Maverick. Para uso comercial, revise a licença e a política de uso aceitável.
Uso local e hardware
A Meta afirma que o Scout pode caber em uma NVIDIA H100 com quantização Int4. O Maverick fica mais próximo de um servidor H100 DGX ou inferência distribuída. Portanto, não é um modelo para rodar confortavelmente em placas de vídeo comuns.
| Hardware | Expectativa |
|---|---|
| 8GB-16GB VRAM | Prefira modelos menores e quantizados |
| 24GB VRAM | Ainda insuficiente para Llama 4 completo |
| H100 | Scout pode ser testado com otimização |
| Servidor multi-GPU | Caminho mais realista para Maverick |
| API hospedada | Melhor início para a maioria dos times |
Desempenho e experiência real
Os materiais oficiais destacam contexto longo, multimodalidade e eficiência. Ao mesmo tempo, a comunidade e a imprensa foram mais cautelosas com alguns benchmarks do Maverick, porque versões experimentais e públicas não eram necessariamente idênticas.
Por isso, a avaliação correta deve usar o modelo exato, o provedor exato e tarefas reais: seus documentos, imagens, código, latência e custo.
Comparação com outros LLMs abertos
| Modelo | Força | Limite | Indicado para |
|---|---|---|---|
| Llama 4 Scout | Contexto extremo e multimodalidade | Hardware alto | RAG e leitura de código |
| Llama 4 Maverick | Assistente multimodal forte | Custo de implantação | Produtos hospedados |
| Qwen 3.8 | Ecossistema local prático | Contexto menos extremo | Uso local realista |
| Gemma 4 | Eficiência e ecossistema Google | Não é NSFW oficial | Assistente geral |
| Dolphin 3 | Rota uncensored clássica | Menos forte em multimodalidade | Roleplay e escrita livre |
| Kimi K3 | MoE enorme e contexto longo | Infraestrutura empresarial | Agentes e RAG corporativo |
NSFW e limites de segurança
O Llama 4 não é um modelo focado em NSFW. O Meta AI e os modelos instruct oficiais têm alinhamento de segurança, com restrições para conteúdo sexual explícito, menores, sexualização de pessoas reais e instruções ilegais.
Pesos abertos dão controle em uma implantação própria, mas isso não equivale a um modo uncensored oficial. Para roleplay adulto ou menor taxa de recusa, modelos comunitários específicos costumam ser mais diretos.
Comunidade e ecossistema
A força do Llama está no ecossistema: provedores cloud, runtimes, fine-tuning, RAG, avaliação e ferramentas de segurança. No Llama 4, porém, MoE e multimodalidade tornam o suporte mais complexo. Confira sempre se versões quantizadas preservam entrada de imagem e contexto longo.
Perguntas frequentes
O Llama 4 é gratuito?
Scout e Maverick usam a Llama 4 Community License. Muitos usos são possíveis, mas a licença tem condições.
Dá para rodar localmente?
Scout é o mais viável, mas ainda requer hardware de classe H100 para uso sério.
Scout ou Maverick?
Scout para contexto enorme; Maverick para qualidade multimodal geral.
Ele entende imagens?
Sim, Scout e Maverick aceitam texto e imagens como entrada.
É uncensored?
Não. Os modelos oficiais têm alinhamento de segurança.
Referências
- Meta Llama 4 official announcement
- Llama 4 Scout on Hugging Face
- Llama 4 Maverick on Hugging Face
- Official Llama downloads
- Llama 4 Community License
- Llama 4 acceptable use policy
- TechCrunch benchmark report
- TechCrunch Maverick follow-up
Conclusão
O Llama 4 é uma evolução importante por juntar open weights, multimodalidade nativa e MoE. Scout é atraente para contexto extremo; Maverick é melhor para aplicações multimodais mais completas.
Mesmo assim, ele não substitui todos os modelos locais. Para hardware modesto, Qwen, Gemma, Mistral ou Llama 3.x podem ser melhores. Para NSFW, modelos comunitários dedicados tendem a ser mais adequados.