Llama 4 Test: Scout, Maverick, Behemoth, lokale Nutzung und NSFW-Politik

Llama 4 ist die Generation, mit der Meta die Llama-Familie in Richtung nativer Multimodalität und Mixture-of-Experts weiterentwickelt. Die Reihe besteht aus Scout für extrem lange…

schedule
article 4 Min. Lesezeit
Titelbild zum Llama 4 Test mit Scout, Maverick und NSFW

Llama 4 ist die Generation, mit der Meta die Llama-Familie in Richtung nativer Multimodalität und Mixture-of-Experts weiterentwickelt. Die Reihe besteht aus Scout für extrem lange Kontexte, Maverick als stärkerem multimodalen Allround-Assistenten und Behemoth als großem Lehrermodell.

Praktisch heißt das: Scout ist spannend für lange Dokumente, RAG und große Codebasen. Maverick passt besser zu Chat, Bildverständnis, Code und gehosteten multimodalen Produkten. Behemoth ist kein normaler Download für den lokalen Einsatz.

Kurzfazit

Punkt Einschätzung
Geeignet für Multimodale Apps, Long-Context-RAG, Coding-Assistenten und private Deployments
Scout 10M Token Kontext, am ehesten für Long-Context-Tests geeignet
Maverick Stärker in Chat, Vision und Code, aber schwerer zu betreiben
Behemoth Lehrermodell, nicht für normalen lokalen Betrieb
Online Meta AI
Download offizielle Downloads / Scout auf Hugging Face / Maverick auf Hugging Face
NSFW Offizielle Modelle sind sicherheitsausgerichtet; kein offizieller NSFW-Modus

Was ist Llama 4

Screenshot der offiziellen Meta-Llama-4-Seite
Meta stellt auf der offiziellen Seite Scout, Maverick und Behemoth als Llama-4-Familie vor.

Meta kündigte Llama 4 am 5. April 2025 an. Scout und Maverick sind Open-Weight-Modelle, während Behemoth vor allem als größeres Lehrermodell dient. Gegenüber Llama 3 sind MoE und native Multimodalität die entscheidenden Schritte.

Native Multimodalität bedeutet, dass Text und Bilder im selben Modell verarbeitet werden. MoE aktiviert pro Token nur ausgewählte Experten. Dadurch entsteht viel Gesamtkapazität bei geringerer aktiver Rechenlast.

Scout, Maverick und Behemoth

Modell Status Parameter Kontext Einsatz
Llama 4 Scout Open-weight 17B aktiv / 109B gesamt / 16 Experten 10M Tokens Lange Dokumente, RAG, Codebasen
Llama 4 Maverick Open-weight 17B aktiv / 400B gesamt / 128 Experten 1M Tokens Chat, Vision, Code, multimodale Apps
Llama 4 Behemoth Preview-Lehrermodell 288B aktiv / fast 2T gesamt Kein normaler lokaler Download Destillation und Forschung

Scout sticht durch die 10M-Token-Kontextlänge hervor. Das ist für lange Dokumente und große Repositories interessant, ersetzt aber keine saubere Retrieval- und Prompt-Strategie.

Maverick ist der stärkere Allrounder. Für ernsthafte Nutzung ist gehostete Inferenz oder Server-Hardware realistischer als ein einzelner Consumer-PC.

Online nutzen und herunterladen

Der einfachste Einstieg ist Meta AI. Entwickler starten über llama.com und die Repositories Llama 4 Scout sowie Llama 4 Maverick. Vor kommerzieller Nutzung sollten Lizenz und Nutzungsrichtlinie geprüft werden.

Lokaler Einsatz und Hardware

Meta beschreibt Scout als Modell, das mit Int4-Quantisierung auf eine NVIDIA H100 passen kann. Maverick zielt eher auf einen H100-DGX-Host oder verteilte Inferenz. Für 8GB-, 12GB- oder 24GB-GPUs ist ein vollständiger Llama-4-Betrieb nicht realistisch.

Hardware Einschätzung
8GB-16GB VRAM Besser kleinere quantisierte Modelle nutzen
24GB VRAM Für vollständiges Llama 4 weiterhin zu knapp
H100 Scout kann testbar werden
Multi-GPU-Server Sinnvoller für Maverick
Gehostete API Praktischster Einstieg

Leistung und echte Erfahrungen

Offizielle Materialien betonen Long Context, Vision und MoE-Effizienz. Externe Berichte waren bei Maverick vorsichtiger, weil Benchmark-Ergebnisse teils auf einer experimentellen Chat-Variante beruhten und nicht direkt der öffentlichen Modellversion entsprachen.

Für Nutzer zählt daher der eigene Test: Dokumente, Bilder, Code, Latenz, Kosten und Provider-Implementierung entscheiden mehr als ein einzelner Leaderboard-Wert.

Vergleich mit anderen offenen LLMs

Modell Stärke Grenze Geeignet für
Llama 4 Scout Extremer Kontext und Multimodalität Hohe Hardwareanforderung RAG und Code-Lektüre
Llama 4 Maverick Starker multimodaler Assistent Deployment-Kosten Gehostete Produkte
Qwen 3.8 Praktisches lokales Ökosystem Weniger extremer Kontext Lokale Nutzer
Gemma 4 Effizienz und Google-Ökosystem Offiziell nicht NSFW-fokussiert Allgemeiner lokaler Assistent
Dolphin 3 Klassische uncensored-Route Kein Frontier-MoE Roleplay und freies Schreiben
Kimi K3 Riesiges MoE und langer Kontext Enterprise-Infrastruktur Agenten und RAG

NSFW und Sicherheitsgrenzen

Llama 4 ist kein NSFW-first-Modell. Meta AI und die offiziellen Instruct-Modelle sind sicherheitsausgerichtet. Explizite sexuelle Inhalte, Minderjährige, Sexualisierung realer Personen und illegale Anleitungen können abgelehnt werden.

Open Weights geben beim Self-Hosting mehr Kontrolle, sind aber kein offizieller uncensored-Modus. Für Adult-Roleplay oder weniger Verweigerungen sind spezialisierte Community-Modelle meist direkter.

Community und Ökosystem

Das Llama-Ökosystem ist stark: Cloud-Anbieter, Inferenz-Runtimes, Fine-Tuning, RAG, Evaluation und Sicherheitstools entstehen schnell. Bei Llama 4 machen MoE und Multimodalität die Unterstützung aber komplexer. Quantisierte Builds sollten vor Produktion genau geprüft werden.

FAQ

Ist Llama 4 kostenlos?

Scout und Maverick stehen unter der Llama 4 Community License. Viele Nutzungen sind möglich, aber die Lizenz hat Bedingungen.

Kann ich Llama 4 lokal ausführen?

Scout ist am realistischsten, braucht aber H100-Klasse. Maverick ist eher Server oder API.

Scout oder Maverick?

Scout für extrem lange Kontexte, Maverick für bessere allgemeine multimodale Qualität.

Unterstützt Llama 4 Bilder?

Ja, Scout und Maverick akzeptieren Text- und Bildeingaben.

Ist Llama 4 uncensored?

Nein, offizielle Versionen sind sicherheitsausgerichtet.

Quellen

Fazit

Llama 4 ist wichtig, weil es Open Weights, native Multimodalität und MoE in einer ernstzunehmenden Größenklasse verbindet. Scout ist für Long Context spannend, Maverick für multimodale Produkte.

Trotzdem ist Llama 4 nicht automatisch die beste Wahl. Für normale Hardware sind kleinere Modelle oft sinnvoller. Für NSFW sind spezialisierte Community-Fine-Tunes direkter. Wer Llama 4 einsetzen will, sollte zuerst reale Aufgaben mit dem konkreten Modell und Provider testen.

Bewertungs-Tags

#Llama 4 #Lokale KI #Meta AI #MoE #multimodale KI #NSFW #Open-Weight LLM

Anmelden

ODER

Konto erstellen

Passwort muss 8-20 Zeichen lang sein und Buchstaben und Zahlen enthalten

ODER

Passwort Vergessen

Passwort muss 8-20 Zeichen lang sein und Buchstaben und Zahlen enthalten