Test de Qwen 3.8 : performances, installation locale, GPU et politique NSFW
Qwen 3.8 se comprend mieux en deux lignes : Qwen3.8-2.4T-A95B / Max pour l’inférence à grande échelle, et Qwen3.8-27B pour les utilisateurs qui veulent tester…
Qwen 3.8 se comprend mieux en deux lignes : Qwen3.8-2.4T-A95B / Max pour l’inférence à grande échelle, et Qwen3.8-27B pour les utilisateurs qui veulent tester un LLM puissant en local ou dans une petite infrastructure. Le premier vise le plafond de performance ; le second est le point d’entrée le plus réaliste.
Si vous vous intéressez à l’installation locale, aux besoins GPU, aux liens de téléchargement, à l’usage commercial et à la politique NSFW, les benchmarks ne suffisent pas. Les versions de Qwen 3.8 diffèrent fortement en taille, licence, coût d’exécution et comportement entre service en ligne et poids téléchargeables.
Sommaire
- Qu’est-ce que Qwen 3.8 ?
- Versions du modèle et téléchargements
- Performances et retours d’usage
- Comparaison avec les LLM locaux populaires
- Installation locale
- Besoins GPU et VRAM
- Utilisation en ligne si le matériel ne suffit pas
- Politique NSFW et limites
- Qwen3.8-27B Uncensored / Abliterated
- Questions fréquentes
- Conclusion
- Informations de référence
Qu’est-ce que Qwen 3.8 ?
Qwen3.8-2.4T-A95B sert de base open weight à la ligne Max, avec 2,4T paramètres et une licence qwen3.8-max indiqués sur la page du modèle.

Qwen3.8-27B est l’option la plus pratique pour les utilisateurs locaux. La page l’indique comme un modèle d’environ 28B paramètres, BF16 et Apache-2.0, donc plus simple à tester et à envisager commercialement.

Versions du modèle et téléchargements
| Modèle | Positionnement | Meilleur usage |
|---|---|---|
| Qwen3.8-2.4T-A95B | Max / 2.4T | Entreprise, recherche, inférence cloud |
| Qwen3.8-2.4T-A95B-FP8 | FP8 | Réduire la mémoire en grande inférence |
| Qwen3.8-27B | 27B / Apache-2.0 | LLM local, RAG, aide au code |
| ModelScope | ModelScope | Environnements Chine/ModelScope |


Performances et retours d’usage
Qwen 3.8 se distingue par le multilingue, le code, le long contexte et l’usage d’outils. Les discussions portent surtout sur la vitesse du 27B, la qualité des versions quantifiées, la maturité vLLM/SGLang et le coût réel de la ligne Max.

Comparaison avec les LLM locaux populaires
| Point clé | Détail |
|---|---|
| Qwen3.8-27B | Bon point d’entrée local pour multilingue et code. |
| Llama / Gemma | Écosystème mûr et petits modèles faciles ; Qwen est fort sur langues asiatiques et code. |
| DeepSeek / Kimi / GLM | Également forts en contexte long ou raisonnement ; testez avec vos données. |
Installation locale
Il est plus raisonnable de commencer par 27B ou une version quantifiée, pas par la ligne 2,4T.

Exemple d’installation
pip install -U transformers accelerate torch safetensors python - <<'PY' from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "Qwen/Qwen3.8-27B" tok = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained( model_id, torch_dtype="auto", device_map="auto", trust_remote_code=True, ) PY Besoins GPU et VRAM
| Usage | VRAM | Note |
|---|---|---|
| Qwen3.8-27B BF16 | 56GB+ | 80 Go est confortable ; 48 Go peut être juste en long contexte. |
| Qwen3.8-27B 4bit | 18-24GB+ | Test possible sur RTX 4090 avec contexte modéré. |
| Qwen3.8-2.4T | Cluster | Pas un modèle de bureau ; plutôt cloud ou entreprise. |
Utilisation en ligne si le matériel ne suffit pas
site officiel Qwen Chat permet de tester le style du modèle avant d’investir dans l’infrastructure locale. La version en ligne peut intégrer outils, vision ou long contexte différemment des poids locaux.

Politique NSFW et limites
Le service en ligne officiel de Qwen n’est pas un chat NSFW sans limites. Contenus sexuels explicites, usages illégaux, instructions dangereuses ou nuisances envers autrui peuvent être restreints. Exécuter les poids localement change l’interface, mais pas les licences, règles de plateforme ni lois locales.
Qwen3.8-27B Uncensored / Abliterated
Les utilisateurs qui veulent tester une variante locale moins restrictive peuvent aussi trouver Huihui-Qwen3.8-27B-abliterated sur Hugging Face. Il s’agit d’une version uncensored / abliterated créée par la communauté à partir de Qwen3.8-27B, et non d’une version officielle de Qwen. En pratique, un modèle « abliterated » réduit généralement les comportements de refus, ce qui le rend plus susceptible de répondre à des requêtes que le service officiel ou des poids alignés sur la sécurité refuseraient.
Ce type de modèle peut être utile pour des tests locaux, des recherches sur l’alignement, l’écriture créative ou la comparaison de comportements. En contrepartie, il demande davantage de prudence : les sorties peuvent être moins filtrées et plus facilement orientées vers des contenus adultes, dangereux ou juridiquement sensibles. Avant de l’utiliser, il faut vérifier la fiche du modèle sur Hugging Face, la licence, les règles de la plateforme et la loi applicable.
Pour la plupart des lecteurs, Qwen3.8-27B officiel ou Qwen Chat reste le point de départ le plus sûr. La version abliterated convient plutôt à des utilisateurs avancés qui comprennent déjà l’hébergement local, la modération et la gestion des risques.
Questions fréquentes
Qwen3.8-Max et 2.4T-A95B sont-ils identiques ?
Pas exactement. Max peut être vu comme la version de service officielle basée sur 2.4T-A95B, avec vision, outils et long contexte.
Peut-on l’exécuter sur une RTX 4090 ?
Une version 4-bit du 27B peut se tester avec contexte court ou moyen ; BF16 et la ligne 2,4T ne sont pas réalistes sur une seule GPU 24 Go.
Peut-on l’utiliser commercialement ?
27B est indiqué en Apache-2.0, plus simple pour une évaluation commerciale ; 2.4T-A95B utilise la licence qwen3.8-max à lire avant déploiement.
Conclusion
La valeur de Qwen 3.8 tient à la fois à la ligne Max de grande échelle et au 27B plus pratique. La plupart des lecteurs devraient commencer par 27B ou Qwen Chat avant d’investir dans une inférence cloud lourde.