Qwen-Image-2.1 im Überblick: Transparenz, Bildbearbeitung, API-Kosten und NSFW

Qwen-Image-2.1: transparente PNGs, Bildbearbeitung, Nutzerberichte, API-Kosten, ComfyUI-Einrichtung, VRAM und Grenzen der Forschungslizenz.

schedule
article 7 Min. Lesezeit
Qwen-Image-2.1 im Überblick: Transparenz, Bildbearbeitung, API-Kosten und NSFW — Redaktionelle Titelillustration, kein mit Qwen erzeugtes Testergebnis.

Qwen-Image-2.1 ist vor allem für Bildmaterial interessant, das anschließend weiterbearbeitet werden soll. Native Transparenz, mehrere Referenzen und gezielte Änderungen an Fotos eignen sich zum Experimentieren mit Stickern, Produktfreistellern und Figurenvarianten.

Zwei Einschränkungen sind entscheidend: Die Gewichte stehen unter einer Forschungslizenz, und die beworbenen 7B beziehen sich nur auf den visuellen Generator. Testen Sie deshalb zuerst die Demo, bevor Sie Hardware kaufen, und klären Sie die Lizenz vor bezahlten Projekten. Stand der Informationen und Preise: 24. September 2026.

Was sich mit Version 2.1 ändert

Das am 20. September 2026 veröffentlichte Qwen-Image-2.1 verbindet Generierung und Bearbeitung. Zu den Neuerungen zählen native RGBA-Bilder, bis zu zehn Referenzbilder sowie lokale Änderungen mit Markierungen oder Masken. Qwen nennt außerdem Verbesserungen bei Schrift, Porträtbeleuchtung und Texturen. Das sind Herstellerangaben, keine Garantie für bessere Ergebnisse bei jedem Auftrag.

Die offizielle Modellkarte nennt Version und Forschungslizenz.
Die offizielle Modellkarte nennt Version und Forschungslizenz.
Funktion Nutzen Worauf achten?
Natives RGBA Freigestellte Motive ohne separaten Freistellungsschritt Echten Alphakanal statt gezeichnetem Schachbrett prüfen
Bis zu 10 Referenzen Personen, Kleidung und Objekte kombinieren Komplexität und Speicherbedarf steigen
Natives 2K Dokumentiertes Quadratformat: 2048 × 2048 Höhere Auflösung belastet den Speicher
7B-Bildgenerator Kompakteres Generierungsmodul Qwen3-VL-8B-Encoder und VAE kommen hinzu

Speichern Sie transparente Ergebnisse als PNG und legen Sie sie über helle und dunkle Flächen. Besonders Haare, Glas und weiche Kanten müssen geprüft werden. Zehn Referenzen sind eine Eingabegrenze, kein Versprechen für zehn unveränderte Gesichter oder fehlerfreie Produktbeschriftungen.

Frühe Nutzerberichte: gute Retuschen, gemischte Bildqualität

Europa Press berichtete über die Veröffentlichung; eine Meldung ersetzt aber keinen unabhängigen Bildvergleich. TheTechnoX beschreibt auf Hugging Face eine INT8-Konfiguration in ComfyUI auf einer RTX 4060 Ti mit 16GB und erfolgreiche lokale Bearbeitungen.

Genannt werden ungefähr 20 Sekunden für Generierung, 60 Sekunden für Bearbeitung und etwa 15GB maximaler VRAM-Verbrauch. Auflösung und Schrittzahl sind nicht vollständig angegeben. Die Werte zeigen eine mögliche Konfiguration, keine garantierte Leistung für andere Rechner.

Ein weiterer Erfahrungsbericht auf Reddit lobt Änderungen an Gesichtsausdruck, Pose und Hintergrund, kritisiert aber teilweise Gelbstich, Körnung und künstlichen Bildeindruck. Auch komplexe Kombinationen mehrerer Elemente überzeugen dort weniger. Unsere Empfehlung: zunächst Transparenz und klar begrenzte Retuschen prüfen. Diese Angaben stammen von Nutzern und sind kein eigener AirMore-GPU-Benchmark.

Online ausprobieren und API-Kosten

Die offizielle Qwen-Demo auf Hugging Face macht die verwendete Version eindeutig. Sie unterstützt englische und chinesische Prompts, Bildreferenzen und Prompt-Erweiterung. Bei einer gemeinsam genutzten Demo können Kapazität und Wartezeit schwanken; unbegrenzte Nutzung oder betriebliche Verfügbarkeit sind nicht zugesichert.

Die offizielle Demo bietet Bildeingaben und Prompt-Erweiterung.
Die offizielle Demo bietet Bildeingaben und Prompt-Erweiterung.
  1. Für Text-zu-Bild zunächst kein Bild hochladen und ein klares Ziel beschreiben.
  2. Für Bearbeitungen ein eigenes Bild hochladen und Änderung sowie unveränderte Bereiche nennen.
  3. Für Freisteller ausdrücklich RGBA und transparenten Hintergrund verlangen; als PNG speichern.
  4. Ergänzungen durch Enhance prompt prüfen und die Funktion bei unerwünschten Details abschalten.
  5. Generate image auswählen und anschließend Schrift und Kanten in Originalgröße kontrollieren.

reAPI ist ein Drittanbieter und berechnet 0,02 USD je 1K-Bild beziehungsweise 0,04 USD je 2K-Bild. Das entspricht ungefähr 0,018 € beziehungsweise 0,035 €; 100 fertige Bilder kosten rechnerisch rund 1,75 € oder 3,51 € vor möglichen Steuern und Gebühren. Es handelt sich nicht um Alibabas offiziellen API-Tarif.

Die deutsche reAPI-Seite bietet Bildgenerierung und API-Zugang.
Die deutsche reAPI-Seite bietet Bildgenerierung und API-Zugang.

Orientierungsumrechnung zum 24. September 2026: 1 USD ≈ 0,8774 €. Sie garantiert keine Abrechnung in Euro. Die API-Dokumentation verwendet die Modell-ID qwen-image-2.1 und asynchrone Aufträge. Für einen eigenen Server gibt es eine vLLM-Omni-Anleitung; Hardware und Betriebskosten übernehmen Sie dabei selbst.

ComfyUI einrichten und VRAM richtig einschätzen

Aktualisieren Sie ComfyUI und verwenden Sie die Comfy-Org-Dateien sowie den offiziellen Workflow für Text-zu-Bild oder Bildbearbeitung. VAE und Knoten einer älteren Version sollten nicht ungeprüft übernommen werden.

Comfy-Org stellt passende Dateien und Beispiel-Workflows bereit.
Comfy-Org stellt passende Dateien und Beispiel-Workflows bereit.

Beispiel für die INT8-Dateien. Bei BF16 wählen Sie stattdessen die tatsächlich heruntergeladenen Varianten in den Ladeknoten:

ComfyUI/models/diffusion_models/
qwen_image_2.1_int8_convrot.safetensors
ComfyUI/models/text_encoders/
qwen3vl_8b_int8_convrot.safetensors
ComfyUI/models/vae/
qwen_image_2.1_vae_bf16.safetensors
  1. Offizielle Workflow-JSON importieren.
  2. Generator, Encoder und VAE in die jeweiligen Ordner legen und die Modellliste aktualisieren.
  3. Dateien in den Ladeknoten auswählen; beim Bearbeitungsworkflow das Ausgangsbild ergänzen.
  4. Zunächst ein Bild mit 1024 × 1024 erzeugen, erst danach Auflösung und Referenzzahl steigern.
  5. Seed, Präzision und Einstellungen dokumentieren, um Ergebnisse sinnvoll vergleichen zu können.

Eine universelle VRAM-Untergrenze lässt sich nicht angeben. Eine vLLM-Messung auf GB300 erreicht etwa 34GB mit BF16 bei 1024 × 1024 und 40 Schritten. Das ist Rechenzentrumshardware, keine Kaufempfehlung für einen Desktop. Der 16GB-Nutzerbericht nutzt Quantisierung und eine andere Softwarekonfiguration; er garantiert keine 2K-Bearbeitung mit zehn Referenzen.

Quantisierung und CPU-Offloading können helfen, verändern aber gegebenenfalls Geschwindigkeit oder Qualität. Auch RAM und SSD-Platz werden benötigt. Die zusätzlichen 9B-Modelle zur Prompt-Erweiterung sind optional und für den ersten Versuch nicht erforderlich.

Vergleich mit älterem Qwen und FLUX.2 klein

Modell Guter Einsatzgrund Wichtigster Kompromiss
Qwen-Image-2.1 Transparenz sowie Generierung und Bearbeitung zusammen Forschungslizenz und variabler Ressourcenbedarf
Qwen-Image-Edit-2511 Bewährte Bearbeitungsabläufe weiterverwenden Erweiterungen nicht automatisch mit 2.1 kompatibel
FLUX.2 [klein] 4B Schnelle Iteration und 4B-Gewichte unter Apache-2.0 Die 9B-Variante hat andere Lizenzbedingungen
Das ältere Modell 2511 bleibt eine Vergleichsbasis für bekannte Aufgaben.
Das ältere Modell 2511 bleibt eine Vergleichsbasis für bekannte Aufgaben.

Vergleichen Sie eigene Aufgaben: Kleidung wechseln und das Gesicht bewahren, Produkttext erhalten, Hintergrund austauschen. Fortschritte bei einer Aufgabe bedeuten nicht zwangsläufig Fortschritte bei allen anderen.

FLUX.2 klein bietet lokale Gewichte und eine offizielle API.
FLUX.2 klein bietet lokale Gewichte und eine offizielle API.

Die klein-4B-API beginnt bei 0,014 USD für das erste Megapixel, mit zusätzlichen Kosten für weitere Pixel und Referenzen. Das ist nicht direkt mit reAPIs 1K-/2K-Stufen vergleichbar. Für Transparenzforschung ist 2.1 interessant; für schnelle Iteration oder eine permissive Gewichtelizenz kommt klein 4B infrage. Dies ist ein Vergleich von Einsatzprofilen, kein Bildqualitätsranking unter gleichen Bedingungen.

Weiterlesen: die Qwen-Image-Modellfamilie

NSFW und kommerzielle Nutzung

Lokaler Betrieb bedeutet keine offizielle Zusage für uneingeschränkte NSFW-Inhalte. Nutzer melden Unterschiede zwischen Generierung und Bearbeitung; Prompt-Erweiterung und die Moderation eines Dienstes können ebenfalls eingreifen. reAPI dokumentiert Prüfungen von Ein- und Ausgaben, seine Regeln gelten weiterhin.

Die Qwen Research License beschränkt die bereitgestellten Materialien auf Forschung und Evaluation; kommerzielle Nutzung benötigt eine separate Lizenz. Als Kontakt wird model-business@notice.qwencloud.com genannt. Übertragen Sie die Apache-2.0-Bedingungen älterer Qwen-Versionen nicht auf 2.1. Auch eine bezahlte API klärt nicht automatisch sämtliche Nutzungsrechte.

Prompts und sinnvolle Anwendungen

  • Transparente Sticker: Motiv, Material, Licht und Alphahintergrund nennen; keinen widersprüchlichen Boden oder Schauplatz hinzufügen.
  • Produkte: Form, Beschriftung, Reflexionen und Kamerawinkel als zu erhaltende Details aufführen und danach prüfen.
  • Mehrere Referenzen: jedem Bild nach Reihenfolge eine Rolle geben und weitere Bilder schrittweise ergänzen.
  • Schrift: Wortlaut in Anführungszeichen und Position vorgeben. Umlaute, ß und Kleingedrucktes kontrollieren.
  • Anime und Porträts: Anatomie und Identität nach mehreren Bearbeitungen prüfen; ein bestimmter Stil ist nicht garantiert.

Beispiel: „Ein Sticker einer orangefarbenen Papierblume, scharfe Ränder, transparenter RGBA-Hintergrund und Platz um das Motiv; ohne Text.“ Für Änderungen: „Nur den blauen Hintergrund durch Hellgrün ersetzen; Flasche, Etikett, Reflexionen und Bildausschnitt erhalten.“ Dies sind Prompt-Vorschläge, keine dokumentierten Benchmark-Ergebnisse.

Häufige Fragen und Fazit

Ist das Modell kostenlos?

Für die Gewichte fällt keine Gebühr pro Bild an. GPU, Strom und gegebenenfalls Miete kosten dennoch Geld; die Forschungslizenz beschränkt die Nutzung. Gehostete Dienste haben eigene Preise.

Reichen 8GB VRAM?

Die 7B-Angabe beantwortet das nicht. Encoder, VAE und Zwischendaten beanspruchen zusätzlichen Speicher. Suchen Sie Tests mit Ihrer konkreten Konfiguration.

Funktionieren alte LoRAs?

Nur bei ausdrücklich bestätigter Unterstützung sollten Sie damit rechnen. Zuerst den offiziellen Workflow ohne Erweiterungen testen.

Warum ist mein Bild nicht transparent?

PNG-Format und Alphakanal prüfen, widersprüchliche Hintergrundwünsche entfernen und das Bild auf zwei Farben betrachten. JPEG bewahrt keine Transparenz.

Lohnt sich der Wechsel?

Für Transparenz und lokale Bildbearbeitung lohnt ein gezielter Versuch. Beginnen Sie mit der Demo und wiederholen Sie einige wichtige Aufgaben, bevor Sie investieren. Behalten Sie das bisherige Modell, bis Konsistenz, Geschwindigkeit und Lizenz passen.

Bei bezahlten Projekten gehört die Lizenz an den Anfang der Auswahl. Ein schönes Beispiel allein macht noch keinen verlässlichen Produktionsablauf.

Bewertungs-Tags

#ComfyUI #NSFW #Qwen #Qwen-Image-2.1

Anmelden

ODER

Konto erstellen

Passwort muss 8-20 Zeichen lang sein und Buchstaben und Zahlen enthalten

ODER

Passwort Vergessen

Passwort muss 8-20 Zeichen lang sein und Buchstaben und Zahlen enthalten