Qwen 3.8 im Test: Leistung, lokale Installation, GPU-Anforderungen und NSFW-Richtlinie

Qwen 3.8 lässt sich am besten in zwei Linien verstehen: Qwen3.8-2.4T-A95B / Max für großskalige Inferenz und Qwen3.8-27B für Nutzer, die ein starkes LLM lokal…

schedule
article 4 Min. Lesezeit
Titelbild zum Qwen 3.8 Test

Qwen 3.8 lässt sich am besten in zwei Linien verstehen: Qwen3.8-2.4T-A95B / Max für großskalige Inferenz und Qwen3.8-27B für Nutzer, die ein starkes LLM lokal oder in kleiner Infrastruktur testen möchten. Die erste Linie zeigt das Leistungspotenzial, die zweite ist der praktischere Einstieg.

Wer lokale Installation, GPU-Anforderungen, Downloadlinks, kommerzielle Nutzung und NSFW-Richtlinien bewerten möchte, sollte nicht nur auf Benchmarks schauen. Die Qwen-3.8-Versionen unterscheiden sich stark bei Größe, Lizenz, Betriebskosten und Verhalten zwischen Online-Dienst und herunterladbaren Gewichten.

Was ist Qwen 3.8?

Qwen3.8-2.4T-A95B ist die Open-Weight-Basis der Max-Linie, mit 2,4T Parametern und qwen3.8-max-Lizenz laut Modellseite.

Qwen3.8-2.4T-A95B Hugging Face
Qwen3.8-2.4T-A95B auf Hugging Face.

Qwen3.8-27B ist die praktikablere Option für lokale Nutzer. Die Seite zeigt etwa 28B Parameter, BF16 und Apache-2.0, was Tests und kommerzielle Bewertung erleichtert.

Qwen3.8-27B Hugging Face
Qwen3.8-27B ist die realistischere Variante für lokale Tests.

Modellversionen und Downloads

Modell Einordnung Bester Einsatz
Qwen3.8-2.4T-A95B Max / 2.4T Unternehmen, Forschung, Cloud-Inferenz
Qwen3.8-2.4T-A95B-FP8 FP8 Speicherbedarf großer Inferenz senken
Qwen3.8-27B 27B / Apache-2.0 Lokales LLM, RAG, Codehilfe
ModelScope ModelScope China-/ModelScope-Umgebungen
Qwen3.8 FP8 model page
Die FP8-Version ist für verteilte Inferenz relevant.
Qwen3.8 ModelScope
ModelScope distribution page for Qwen3.8-2.4T-A95B.

Leistung und Praxiseindruck

Qwen 3.8 punktet bei Mehrsprachigkeit, Code, langem Kontext und Tool-Nutzung. In der Community geht es vor allem darum, ob 27B schnell genug ist, Quantisierungen gut funktionieren, vLLM/SGLang reif sind und sich die Max-Linie in der Cloud lohnt.

Prismix LLM news page
Community and release news around modern LLMs.

Vergleich mit beliebten lokalen LLMs

Kernpunkt Details
Qwen3.8-27B Guter lokaler Einstieg für Mehrsprachigkeit und Code.
Llama / Gemma Reifes Ökosystem und kleinere Modelle; Qwen ist stark bei asiatischen Sprachen und Code.
DeepSeek / Kimi / GLM Ebenfalls stark bei langem Kontext oder Reasoning; mit eigenen Daten testen.

Lokale Installation

Sinnvoll ist der Einstieg über 27B oder eine quantisierte Variante, nicht über die 2,4T-Linie.

vLLM supported models documentation
Die vLLM-Dokumentation hilft bei der Prüfung lokaler oder selbst gehosteter Inferenz.

Installationsbeispiel

pip install -U transformers accelerate torch safetensors python - <<'PY' from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "Qwen/Qwen3.8-27B" tok = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained( model_id, torch_dtype="auto", device_map="auto", trust_remote_code=True, ) PY

GPU- und VRAM-Anforderungen

Nutzung VRAM Hinweis
Qwen3.8-27B BF16 56GB+ 80GB ist komfortabel; 48GB kann bei langem Kontext knapp sein.
Qwen3.8-27B 4bit 18-24GB+ Auf RTX 4090 mit moderatem Kontext testbar.
Qwen3.8-2.4T Cluster Kein Desktop-Modell; eher Cloud oder Unternehmen.

Online nutzen, wenn die Hardware nicht reicht

offizielle Qwen-Chat-Seite hilft, den Modellstil vor lokaler Infrastruktur zu testen. Online können Tools, Vision oder langer Kontext anders integriert sein als bei lokalen Gewichten.

Qwen Chat official website
Qwen Chat online interface.

NSFW-Richtlinie und Grenzen

Der offizielle Qwen-Onlinedienst ist kein unbegrenzter NSFW-Chat. Explizite sexuelle Inhalte, illegale Nutzung, gefährliche Anleitungen oder Schaden für Dritte können eingeschränkt sein. Lokale Gewichte ändern die Laufzeit, aber nicht Lizenzen, Plattformregeln oder lokale Gesetze.

Qwen3.8-27B Uncensored / Abliterated

Wer eine lokal nutzbare Variante mit weniger Einschränkungen testen möchte, findet auf Hugging Face auch Huihui-Qwen3.8-27B-abliterated. Dabei handelt es sich um eine von der Community erstellte uncensored / abliterated Version auf Basis von Qwen3.8-27B, nicht um eine offizielle Qwen-Veröffentlichung. In der Praxis bedeutet „abliterated“ meist, dass Ablehnungsverhalten abgeschwächt wurde und das Modell eher auf Prompts antwortet, die der offizielle Chatdienst oder sicherheitsabgestimmte Gewichte ablehnen würden.

Das kann für lokale Tests, Alignment-Forschung, kreatives Schreiben oder den Vergleich von Modellverhalten nützlich sein. Gleichzeitig steigt die Verantwortung des Nutzers: Ausgaben können weniger gefiltert sein und leichter in erwachsene, unsichere oder rechtlich sensible Bereiche gelenkt werden. Vor der Nutzung sollten die Hugging-Face-Modellkarte, Lizenz, Plattformregeln und geltendes Recht geprüft werden.

Für die meisten Anwender bleiben das offizielle Qwen3.8-27B oder Qwen Chat der sicherere Einstieg. Die abliterated Version ist eher eine fortgeschrittene lokale Option für Nutzer, die Hosting, Moderation und Risikomanagement bereits verstehen.

Häufige Fragen

Sind Qwen3.8-Max und 2.4T-A95B identisch?

Nicht exakt. Max ist eher die offizielle Service-Version auf Basis von 2.4T-A95B, mit Vision, Tools und langem Kontext.

Läuft es auf einer RTX 4090?

Eine 4-bit-Version von 27B kann mit kurzem bis mittlerem Kontext laufen; BF16 und 2,4T sind auf einer einzelnen 24GB-GPU unrealistisch.

Ist kommerzielle Nutzung möglich?

27B wird als Apache-2.0 angezeigt und ist für kommerzielle Bewertung einfacher; 2.4T-A95B nutzt qwen3.8-max und erfordert Lizenzprüfung.

Fazit

Der Wert von Qwen 3.8 liegt in der Kombination aus großer Max-Linie und praktischem 27B. Die meisten sollten mit 27B oder Qwen Chat starten, bevor sie schwere Cloud-Inferenz planen.

Referenzinformationen

Anmelden

ODER

Konto erstellen

Passwort muss 8-20 Zeichen lang sein und Buchstaben und Zahlen enthalten

ODER

Passwort Vergessen

Passwort muss 8-20 Zeichen lang sein und Buchstaben und Zahlen enthalten