Avis Llama 4 : Scout, Maverick, Behemoth, déploiement local et politique NSFW

Llama 4 est la génération avec laquelle Meta fait évoluer Llama vers une architecture MoE nativement multimodale. La famille repose sur Scout pour le très…

schedule
article 6 min de lecture
Couverture de l'avis Llama 4 avec Scout, Maverick et NSFW

Llama 4 est la génération avec laquelle Meta fait évoluer Llama vers une architecture MoE nativement multimodale. La famille repose sur Scout pour le très long contexte, Maverick pour l’assistant multimodal généraliste et Behemoth comme modèle enseignant de très grande taille.

En pratique, Scout convient aux documents volumineux, au RAG et aux grands dépôts de code. Maverick est plus pertinent pour le chat, la vision, le code et les produits multimodaux. Behemoth n’est pas un modèle à télécharger pour un usage local classique.

Verdict rapide

Point Résumé
Idéal pour Applications multimodales, RAG long contexte, assistants de code, déploiements privés
Scout Contexte 10M tokens, modèle Llama 4 le plus intéressant pour le long contexte
Maverick Meilleure qualité générale en chat, vision et code, mais plus lourd
Behemoth Modèle enseignant, pas un modèle local courant
En ligne Meta AI
Téléchargement Téléchargements officiels / Scout sur Hugging Face / Maverick sur Hugging Face
NSFW Modèles officiels alignés pour la sécurité, sans mode NSFW officiel

Qu'est-ce que Llama 4

Capture de la page officielle Meta Llama 4
La page officielle de Meta présente Scout, Maverick et Behemoth dans la famille Llama 4.

Meta a annoncé Llama 4 le 5 avril 2025. Scout et Maverick sont proposés en open-weight, tandis que Behemoth sert surtout de modèle enseignant pour améliorer les versions plus utilisables.

La multimodalité native permet de traiter texte et images dans une même architecture. Le MoE active seulement certains experts par token, ce qui permet une grande capacité totale avec un calcul actif plus limité.

Scout, Maverick et Behemoth

Modèle Statut Paramètres Contexte Usage
Llama 4 Scout Open-weight 17B actifs / 109B totaux / 16 experts 10M tokens Documents longs, RAG, grands dépôts
Llama 4 Maverick Open-weight 17B actifs / 400B totaux / 128 experts 1M tokens Chat, vision, code, applications multimodales
Llama 4 Behemoth Enseignant en preview 288B actifs / presque 2T totaux Pas un téléchargement local normal Distillation et recherche

Scout est remarquable pour sa fenêtre de contexte. Elle peut changer la donne pour de très grands corpus, mais la qualité dépend aussi du runtime, de la mémoire et de la stratégie de récupération.

Maverick est plus adapté comme assistant général multimodal. Il est plus lourd et se prête mieux à l’inférence hébergée ou aux serveurs spécialisés.

Accès en ligne et téléchargements

Le moyen le plus simple de tester est Meta AI. Les développeurs peuvent partir de llama.com et des dépôts Llama 4 Scout et Llama 4 Maverick. Avant une utilisation commerciale, consultez la licence et la politique d'utilisation.

Déploiement local et matériel

Meta indique que Scout peut tenir sur une NVIDIA H100 avec quantification Int4. Maverick demande plutôt un serveur H100 DGX ou une inférence distribuée. Sur un GPU grand public, Llama 4 complet n’est donc pas un choix réaliste.

Matériel Attente réaliste
8GB-16GB VRAM Préférer des modèles plus petits
24GB VRAM Trop juste pour Llama 4 complet
H100 Scout peut devenir testable
Serveur multi-GPU Plus adapté à Maverick
API hébergée Meilleur point d’entrée

Performances et retours réels

Les annonces officielles mettent en avant le contexte long, la vision et l’efficacité MoE. Les retours externes sont plus nuancés, notamment à cause de débats autour des benchmarks de Maverick et de différences entre variantes expérimentales et publiques.

Le bon réflexe consiste à tester le modèle exact sur vos propres tâches. Les documents, images, dépôts de code, contraintes de latence et coûts comptent autant que les scores publics.

Comparaison avec d'autres LLM ouverts

Modèle Atout Limite Pour qui
Llama 4 Scout Très long contexte et multimodalité Matériel exigeant RAG et lecture de code
Llama 4 Maverick Assistant multimodal puissant Coût de déploiement Produits hébergés
Qwen 3.8 Écosystème local pratique Contexte moins extrême Utilisateurs locaux
Gemma 4 Efficacité et écosystème Google Pas centré NSFW officiellement Assistant général
Dolphin 3 Route uncensored classique Moins frontier multimodal Écriture et roleplay
Kimi K3 Très grand MoE et long contexte Infrastructure lourde Agents et RAG d’entreprise

NSFW et limites de sécurité

Llama 4 n’est pas un modèle NSFW. Meta AI et les modèles instruct officiels sont alignés pour la sécurité. Les contenus sexuels explicites, les mineurs, la sexualisation de personnes réelles et les instructions illégales peuvent être refusés.

Les poids ouverts donnent plus de contrôle en auto-hébergement, mais il ne s’agit pas d’un mode uncensored officiel. Pour du roleplay adulte, des modèles communautaires spécialisés sont généralement plus directs.

Communauté et écosystème

Llama dispose d’un écosystème très solide : fournisseurs cloud, runtimes, fine-tuning, RAG, évaluation et outils de sécurité. Avec Llama 4, le MoE et la multimodalité rendent toutefois le support plus délicat. Vérifiez les versions quantifiées avant de les utiliser en production.

FAQ

Llama 4 est-il gratuit ?

Scout et Maverick sont distribués sous Llama 4 Community License. De nombreux usages sont possibles, mais la licence comporte des conditions.

Peut-on l'exécuter localement ?

Scout est le plus réaliste, mais il vise plutôt du matériel H100. Maverick est surtout serveur ou API.

Scout ou Maverick ?

Scout pour le très long contexte ; Maverick pour la qualité multimodale générale.

Comprend-il les images ?

Oui, Scout et Maverick acceptent texte et images.

Est-il uncensored ?

Non, les versions officielles sont alignées pour la sécurité.

Références

Conclusion

Llama 4 est une avancée importante : open-weight, multimodalité native et MoE à grande échelle. Scout est fascinant pour le contexte long, Maverick pour les applications multimodales plus complètes.

Le choix doit rester pragmatique. Pour un PC classique, des modèles plus petits seront souvent meilleurs. Pour le NSFW, des fine-tunes communautaires sont plus adaptés. Testez d’abord vos propres cas d’usage avant de décider.

Se connecter

OU

Créer un compte

Le mot de passe doit contenir entre 8 et 20 caractères et inclure des lettres et des chiffres

OU

Mot de Passe Oublié

Le mot de passe doit contenir entre 8 et 20 caractères et inclure des lettres et des chiffres