Llama 4 Test: Scout, Maverick, Behemoth, lokale Nutzung und NSFW-Politik
Llama 4 ist die Generation, mit der Meta die Llama-Familie in Richtung nativer Multimodalität und Mixture-of-Experts weiterentwickelt. Die Reihe besteht aus Scout für extrem lange…
Llama 4 ist die Generation, mit der Meta die Llama-Familie in Richtung nativer Multimodalität und Mixture-of-Experts weiterentwickelt. Die Reihe besteht aus Scout für extrem lange Kontexte, Maverick als stärkerem multimodalen Allround-Assistenten und Behemoth als großem Lehrermodell.
Praktisch heißt das: Scout ist spannend für lange Dokumente, RAG und große Codebasen. Maverick passt besser zu Chat, Bildverständnis, Code und gehosteten multimodalen Produkten. Behemoth ist kein normaler Download für den lokalen Einsatz.
Inhalt
Kurzfazit
| Punkt | Einschätzung |
|---|---|
| Geeignet für | Multimodale Apps, Long-Context-RAG, Coding-Assistenten und private Deployments |
| Scout | 10M Token Kontext, am ehesten für Long-Context-Tests geeignet |
| Maverick | Stärker in Chat, Vision und Code, aber schwerer zu betreiben |
| Behemoth | Lehrermodell, nicht für normalen lokalen Betrieb |
| Online | Meta AI |
| Download | offizielle Downloads / Scout auf Hugging Face / Maverick auf Hugging Face |
| NSFW | Offizielle Modelle sind sicherheitsausgerichtet; kein offizieller NSFW-Modus |
Was ist Llama 4

Meta kündigte Llama 4 am 5. April 2025 an. Scout und Maverick sind Open-Weight-Modelle, während Behemoth vor allem als größeres Lehrermodell dient. Gegenüber Llama 3 sind MoE und native Multimodalität die entscheidenden Schritte.
Native Multimodalität bedeutet, dass Text und Bilder im selben Modell verarbeitet werden. MoE aktiviert pro Token nur ausgewählte Experten. Dadurch entsteht viel Gesamtkapazität bei geringerer aktiver Rechenlast.
Scout, Maverick und Behemoth
| Modell | Status | Parameter | Kontext | Einsatz |
|---|---|---|---|---|
| Llama 4 Scout | Open-weight | 17B aktiv / 109B gesamt / 16 Experten | 10M Tokens | Lange Dokumente, RAG, Codebasen |
| Llama 4 Maverick | Open-weight | 17B aktiv / 400B gesamt / 128 Experten | 1M Tokens | Chat, Vision, Code, multimodale Apps |
| Llama 4 Behemoth | Preview-Lehrermodell | 288B aktiv / fast 2T gesamt | Kein normaler lokaler Download | Destillation und Forschung |
Scout sticht durch die 10M-Token-Kontextlänge hervor. Das ist für lange Dokumente und große Repositories interessant, ersetzt aber keine saubere Retrieval- und Prompt-Strategie.
Maverick ist der stärkere Allrounder. Für ernsthafte Nutzung ist gehostete Inferenz oder Server-Hardware realistischer als ein einzelner Consumer-PC.
Online nutzen und herunterladen
Der einfachste Einstieg ist Meta AI. Entwickler starten über llama.com und die Repositories Llama 4 Scout sowie Llama 4 Maverick. Vor kommerzieller Nutzung sollten Lizenz und Nutzungsrichtlinie geprüft werden.
Lokaler Einsatz und Hardware
Meta beschreibt Scout als Modell, das mit Int4-Quantisierung auf eine NVIDIA H100 passen kann. Maverick zielt eher auf einen H100-DGX-Host oder verteilte Inferenz. Für 8GB-, 12GB- oder 24GB-GPUs ist ein vollständiger Llama-4-Betrieb nicht realistisch.
| Hardware | Einschätzung |
|---|---|
| 8GB-16GB VRAM | Besser kleinere quantisierte Modelle nutzen |
| 24GB VRAM | Für vollständiges Llama 4 weiterhin zu knapp |
| H100 | Scout kann testbar werden |
| Multi-GPU-Server | Sinnvoller für Maverick |
| Gehostete API | Praktischster Einstieg |
Leistung und echte Erfahrungen
Offizielle Materialien betonen Long Context, Vision und MoE-Effizienz. Externe Berichte waren bei Maverick vorsichtiger, weil Benchmark-Ergebnisse teils auf einer experimentellen Chat-Variante beruhten und nicht direkt der öffentlichen Modellversion entsprachen.
Für Nutzer zählt daher der eigene Test: Dokumente, Bilder, Code, Latenz, Kosten und Provider-Implementierung entscheiden mehr als ein einzelner Leaderboard-Wert.
Vergleich mit anderen offenen LLMs
| Modell | Stärke | Grenze | Geeignet für |
|---|---|---|---|
| Llama 4 Scout | Extremer Kontext und Multimodalität | Hohe Hardwareanforderung | RAG und Code-Lektüre |
| Llama 4 Maverick | Starker multimodaler Assistent | Deployment-Kosten | Gehostete Produkte |
| Qwen 3.8 | Praktisches lokales Ökosystem | Weniger extremer Kontext | Lokale Nutzer |
| Gemma 4 | Effizienz und Google-Ökosystem | Offiziell nicht NSFW-fokussiert | Allgemeiner lokaler Assistent |
| Dolphin 3 | Klassische uncensored-Route | Kein Frontier-MoE | Roleplay und freies Schreiben |
| Kimi K3 | Riesiges MoE und langer Kontext | Enterprise-Infrastruktur | Agenten und RAG |
NSFW und Sicherheitsgrenzen
Llama 4 ist kein NSFW-first-Modell. Meta AI und die offiziellen Instruct-Modelle sind sicherheitsausgerichtet. Explizite sexuelle Inhalte, Minderjährige, Sexualisierung realer Personen und illegale Anleitungen können abgelehnt werden.
Open Weights geben beim Self-Hosting mehr Kontrolle, sind aber kein offizieller uncensored-Modus. Für Adult-Roleplay oder weniger Verweigerungen sind spezialisierte Community-Modelle meist direkter.
Community und Ökosystem
Das Llama-Ökosystem ist stark: Cloud-Anbieter, Inferenz-Runtimes, Fine-Tuning, RAG, Evaluation und Sicherheitstools entstehen schnell. Bei Llama 4 machen MoE und Multimodalität die Unterstützung aber komplexer. Quantisierte Builds sollten vor Produktion genau geprüft werden.
FAQ
Ist Llama 4 kostenlos?
Scout und Maverick stehen unter der Llama 4 Community License. Viele Nutzungen sind möglich, aber die Lizenz hat Bedingungen.
Kann ich Llama 4 lokal ausführen?
Scout ist am realistischsten, braucht aber H100-Klasse. Maverick ist eher Server oder API.
Scout oder Maverick?
Scout für extrem lange Kontexte, Maverick für bessere allgemeine multimodale Qualität.
Unterstützt Llama 4 Bilder?
Ja, Scout und Maverick akzeptieren Text- und Bildeingaben.
Ist Llama 4 uncensored?
Nein, offizielle Versionen sind sicherheitsausgerichtet.
Quellen
- Meta Llama 4 official announcement
- Llama 4 Scout on Hugging Face
- Llama 4 Maverick on Hugging Face
- Official Llama downloads
- Llama 4 Community License
- Llama 4 acceptable use policy
- TechCrunch benchmark report
- TechCrunch Maverick follow-up
Fazit
Llama 4 ist wichtig, weil es Open Weights, native Multimodalität und MoE in einer ernstzunehmenden Größenklasse verbindet. Scout ist für Long Context spannend, Maverick für multimodale Produkte.
Trotzdem ist Llama 4 nicht automatisch die beste Wahl. Für normale Hardware sind kleinere Modelle oft sinnvoller. Für NSFW sind spezialisierte Community-Fine-Tunes direkter. Wer Llama 4 einsetzen will, sollte zuerst reale Aufgaben mit dem konkreten Modell und Provider testen.