MiniMax H3 Image Studio im Überblick: ComfyUI-Bilder, Bearbeitung und Video
MiniMax H3 Image Studio: Modelle, Installation, GPU-Bedarf, Referenzbearbeitung, NSFW-Grenzen und ein Workflow von Standbildern zu H3-Videos.
MiniMax H3 Image Studio ist vor allem dann interessant, wenn du bereits Videos mit H3 erstellst und Figuren, Produkte oder Szenen im selben ComfyUI-System vorbereiten möchtest. Die Erweiterung nutzt das Videomodell zur Erzeugung von Standbildern und zur Bearbeitung anhand von Referenzen.
Der Vorteil liegt in der Wiederverwendung deiner Umgebung. Es handelt sich weder um einen offiziellen MiniMax-Onlinedienst für Bilder noch um ein kleines eigenständiges Bildmodell. H3 und sein Encoder bleiben nötig. Feine Details, exakte Schrift und gleichbleibende Figuren müssen geprüft werden.
Stand: 28. September 2026 · Community-Erweiterung v23.0.0
Was ist das Projekt und für wen lohnt es sich?
Das Projekt wird von astropuzzo gepflegt. Der übliche Workflow erzeugt eine kurze Bildfolge, decodiert sie und wählt ein Standbild. Es ist kein neu trainiertes MiniMax-Bildmodell. Die aktuelle Version bietet abgestimmte Vier-Schritt-Entwürfe und Acht-Schritt-Workflows mit ungefähr 1 MP. Einzelbild-Sampling und alternative Decoder bleiben experimentell. Projekt-Repository · Versionsverlauf.
Sinnvoll ist ein kleiner Satz geprüfter Referenzen: Porträt, Ganzkörperansicht und Hintergrund. Auch Produktfarben und Kleidung lassen sich vor der Animation ausprobieren. Für eine gelegentliche Illustration kann die Installation eines kompletten Videomodells unverhältnismäßig sein.
Behandle Ausgaben zunächst als Kandidaten. Prüfe Gesicht, Hände, Nähte, Logos und Objektzahl vor der Animation. Kleine Fehler können in Bewegung deutlich stärker auffallen.

Hardware, Kosten und Online-Nutzung
Eine allgemeingültige Mindest-VRAM-Angabe gibt es für diese Workflows nicht. Der Entwickler testete v23 mit RTX 4090, 24 GB VRAM und 64 GB RAM. Ein Community-Bericht vom 26. September zeigt Referenzbearbeitung mit RTX 4070, 12 GB VRAM und 48 GB RAM. Das belegt eine konkrete Konfiguration, nicht den problemlosen Betrieb jedes 4-MP-Workflows auf jeder 12-GB-Karte. Testbedingungen · RTX-4070-Bericht.
Vorhandene kompatible H3-Gewichte und Encoder lassen sich weiterverwenden. Plane SSD-Speicher für Modelle und Ergebnisse ein. Bei knappem VRAM steigen die Anforderungen an RAM und Auslagerung. Beginne mit etwa 1 MP, fünf Frames und einem Bild pro Durchlauf; erfolgreiches Laden bedeutet noch nicht schnelles Arbeiten.
| Betrieb | Kosten | Entscheidungshilfe |
|---|---|---|
| ComfyUI lokal | Keine Abo- oder Bild-Credits für das Node-Paket; Hardware, Strom, Speicher und gegebenenfalls Lizenzen kosten trotzdem. | Besonders sinnvoll mit bereits vorhandenem H3-Rechner. |
| Gemietete GPU | GPU-Laufzeit, dauerhafter Speicher und eventuell Datentransfer. | Installation dieser Erweiterung und Gewichte vorher bestätigen lassen. |
| Comfy Cloud | Aktuelle Tarif- und Verbrauchsbedingungen; kommerzielle H3-Ausgaberechte werden als enthalten beschrieben. | H3-Unterstützung bestätigt nicht automatisch dieses Community-Paket. |
Comfy Cloud bietet unterstützte H3-Workflows online, ist damit aber kein hier bestätigter Image-Studio-Dienst mit einem Klick. Kläre Nodes, Modelle und Lizenzumfang vor einer Zahlung. Die API-JSON-Dateien sind für ComfyUI-Clients gedacht, nicht für eine gesondert verkaufte MiniMax Image Studio API. Vergleiche Kosten pro tatsächlich brauchbarem Referenzbild einschließlich Fehlversuchen und Einrichtung.
Modelle herunterladen und Nodes installieren
Aktualisiere ComfyUI auf 0.30.0 oder neuer und nutze einen aktuellen Workflow statt gemischter Einstellungen aus alten Tutorials. H3-Anleitung von ComfyUI · Modelle · Turbo-Adapter. Generierung und Referenzbearbeitung benötigen unterschiedliche Varianten; lade zunächst nur die benötigte herunter.
| Bestandteil | Datei oder Download | ComfyUI-Ordner |
|---|---|---|
| Generierungsmodell | minimax_h3_fl2va_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| Referenzbearbeitungsmodell | minimax_h3_ref2va_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| Text-/Vision-Encoder | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | models/text_encoders/ |
| Video-VAE | minimax_h3_video_vae_fp16.safetensors | models/vae/ |
| Acht-Schritt-Adapter für Generierung | minimax_h3_fl2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors | models/loras/ |
| Acht-Schritt-Adapter für Bearbeitung | minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors | models/loras/ |
Suche im ComfyUI Manager nach MiniMax H3 Image Studio oder führe die Befehle aus dem Verzeichnis aus, das den ComfyUI-Ordner enthält. Bei Portable musst du den Pfad anpassen. Anschließend neu starten. Die Node-Installation lädt nicht automatisch sämtliche Gewichte.
cd ComfyUI/custom_nodes
git clone https://github.com/astropuzzo/ComfyUI-MiniMax-H3-Image-Studio.git Das erste Bild erzeugen und bearbeiten
Für die sichtbare Arbeitsfläche brauchst du UI JSON. Dateien unter examples/api enthalten API-Aufträge, nicht das Canvas-Layout. Hier sind die tatsächlichen Workflows des Maintainers:
- Bildgenerierung mit acht Schritten — H3_IMAGE_GENERATE.json
- Bearbeitung mit acht Schritten — H3_IMAGE_EDIT.json
- Bildentwurf mit vier Schritten — H3_IMAGE_DRAFT.json
- Bearbeitungsentwurf mit vier Schritten — H3_EDIT_DRAFT.json
- Basisbearbeitung mit zwei Referenzen — H3_REFERENCE_EDIT.json
Zunächst ein Bild erzeugen
- Öffne H3_IMAGE_GENERATE.json und wähle FL2VA, Qwen-Encoder, Video-VAE sowie den passenden FL2VA-Adapter für 768p und acht Schritte.
- Wähle das Seitenverhältnis für dein späteres Video. Behalte beim ersten Versuch ungefähr 1 MP, fünf Frames und das mitgelieferte Sampling bei.
- Beschreibe Motiv, Ausschnitt, Licht und Hintergrund als Standbild. Ändere den Seed für einige Varianten und prüfe sie in voller Größe.
- Speichere das gewählte PNG, Workflow und Seed. Bewahre das Original auf, auch wenn du später eine Kopie nachbearbeitest.
Eine Referenz bearbeiten, ohne sie festzuschreiben
- Öffne H3_IMAGE_EDIT.json, wähle REF2VA mit passendem Acht-Schritt-Adapter und lade die Quelle in Load Image.
- Beschreibe Änderung und zu erhaltende Merkmale. Beginne mit native als Referenztransport; semantic-only ist experimentell.
- Für zwei getrennte Referenzrollen nutze H3_REFERENCE_EDIT.json und befülle beide Load-Image-Nodes. Benenne <Picture 1> und <Picture 2> im Prompt. Dieser Basisworkflow unterscheidet sich vom Turbo-Workflow.
- Starte bei source_fidelity ungefähr mit 0.6. Der Wert beeinflusst Erhaltungsanweisungen, nicht die Denoise-Stärke. Prüfe gewünschte wie unbeabsichtigte Änderungen.
Die mitgelieferten Acht-Schritt-Rezepte für 768p nutzen Video-/Audio-Shifts 6/3 bei FL2VA und 12/3 bei REF2VA. Modell, Adapter und Rezept müssen zusammenpassen. Nur acht Schritte durch vier zu ersetzen, entspricht nicht dem Draft-Workflow. Standbilder benötigen normalerweise den Video-VAE, keinen Audio-VAE; für vollständige Videos können beide nötig sein.

Vom Referenzbild zum H3-Video
Die Verbindung besteht in der Weiterverwendung eines PNGs, wie bei anderen Referenzbildern. Es gibt keinen veröffentlichten Vergleich, der allein durch Image Studio eine bessere Identitätstreue garantiert. Unser MiniMax-H3-Review erläutert die Videoumgebung.
- Bestimme die Rolle: Image-to-Video/FL2VA animiert die Ausgangskomposition; Reference-to-Video/REF2VA überträgt Identität, Kleidung oder Stil auf eine andere Szene.
- Exportiere eine klare Einzelansicht. Eine Dreiseitenansicht als Startframe kann drei Figuren im Video ergeben. Trenne Ansichten bei Bedarf.
- Öffne die passende native H3-Videovorlage, lade das PNG und benenne seine Funktion. Eine andere Dateiendung macht aus einem Bildworkflow kein Video.
- Teste einen kurzen Clip mit einfacher Handlung und allen benötigten Video-/Audiokomponenten. Die native Anleitung nennt 1344×768 als H3-Startgröße für 16:9; übernimm experimentelle 4-MP-Bildeinstellungen nicht ungeprüft.
- Prüfe Identität, Bewegung, unerwünschte Schrift und Beschnitt. Erhöhe erst danach Länge, Referenzzahl oder Kamerabewegung. Dokumentiere Bild- und Videoseeds getrennt.
Anleitung für native Bild-zu-Video- und Referenz-zu-Video-Workflows.
Prompts für Referenzen und Animation
Die Beispiele sind anpassbare Ausgangspunkte, keine gemessenen Testergebnisse. Die englischen Prompts erhalten die Syntax
Figurenreferenz für eine spätere Einstellung
A single full-body reference image of an adult explorer in a teal raincoat and brown boots, standing neutrally against a plain light-gray background. The entire figure is visible, with relaxed hands and unobstructed facial features. Soft even studio lighting, realistic proportions, no text, no collage. Eine neutrale Einzelansicht lässt sich leichter prüfen. Erzeuge weitere Ansichten separat, wenn Gesichtsdetails wichtig sind.
Ein Produkt bearbeiten
Use <Picture 1> as the source product. Change only the ceramic cup colour from white to deep blue. Retain the handle shape, camera angle, wooden tabletop and soft side lighting. Output one product photograph, with no additional objects or lettering. Beginne mit einem markenlosen Objekt. Prüfe neben Farbe auch Form, Material, Reflexionen und Proportionen.
Zwei Referenzen mit getrennten Rollen
Use <Picture 1> for the adult character identity, hairstyle and clothing. Use <Picture 2> only for the standing body pose. Place the character against a plain gray background. Preserve the face and outfit from <Picture 1>; visibly adopt the pose from <Picture 2>. Output a single image, not a comparison sheet. Wenn Picture 2 die Pose vorgibt, fordere nicht gleichzeitig den Erhalt der Pose aus Picture 1.
Das freigegebene Startbild animieren
Animate this opening image into a short continuous shot. The adult explorer slowly turns toward the window and lifts one hand. The camera stays still. Preserve the face, teal coat and room layout. Gentle fabric movement, natural timing, no cuts and no on-screen text. Dieser Prompt gehört in die Videovorlage. Einfache Bewegungen erleichtern die Fehlersuche.
Bildqualität und veröffentlichte Erfahrungen
Der Fotograf Kazuhisa Nishikawa demonstrierte am 15. August bei TechnoEdge Bildgenerierung, Kleidungsfarbwechsel und Bearbeitung mit zwei Referenzen. Er lobte die Möglichkeiten, sah aber weniger Details als bei spezialisierten Bildmodellen wie Krea 2 und Z-Image. Seine damaligen Einstellungen sind nicht die aktuellen v23-Standardwerte. Praxisbericht.
Kamimotos Beitrag vom 26. September zeigt Anime-Referenzblätter und Szenenwechsel auf einer RTX 4070. Er nennt auch weiche Ganzkörperdetails und unvollständige Stiltreue. Das spricht für Vorproduktion und Experimente, nicht für garantiert exakte fertige Modellblätter. Community-Beispiele.
Der v23-Vergleich des Entwicklers nutzt feste Prompts und Seeds und lässt Fehler sichtbar. Kleidung und Posen ändern sich, andere Merkmale bleiben aber nicht vollständig erhalten. Mehr Frames helfen nicht immer. Ein lesbares Schild mit vier Buchstaben ist kein Typografie-Benchmark. Prüfe Umlaute, ß und Kleingedrucktes; endgültige Schrift lässt sich für Präzision separat setzen. Messungen und Bildvergleiche.

| Entwicklerbeispiel | Basis 20 Schritte | Turbo 8 Schritte | Turbo 4 Schritte |
|---|---|---|---|
| Porträt, 1024×1024, Seed 105 | 10,87 s | 7,31 s | 4,41 s |
| Jackenbearbeitung, 1440×1440, Seed 205 | 25,04 s | 13,88 s | 13,26 s |
Einzelbeobachtungen auf RTX 4090/24 GB, keine Durchschnittswerte oder AirMore-Messungen. Laden, Cache, Modellwechsel und Speichern beeinflussen die Zeit. Der optionale Qwen-Refiner ist eine weitere generative Bearbeitung und kann Gesicht oder Beleuchtung verändern. Vergleiche bei 100 % statt von verlustfreier Wiederherstellung auszugehen.
Vergleich: Qwen Image Edit und FLUX.2 [klein]
| Option | Guter Einsatzgrund | Wichtigster Kompromiss |
|---|---|---|
| MiniMax H3 Image Studio | Vorhandenes H3 für Referenzvorbereitung und Video weiterverwenden. | Großer Video-Modellstapel und H3-Lizenzbedingungen. |
| Qwen-Image-Edit-2511 | Spezialisierte Referenz-, Gruppen- oder Materialbearbeitung. | Separater Modellstapel und nötige Sichtkontrolle. |
| FLUX.2 [klein] 4B | Kleineres dediziertes Modell mit lokalem und gehostetem Zugang. | Anderer Bildcharakter und Umgang mit Referenzen; eigene Motive vergleichen. |
Die Qwen-Modellkarte beschreibt Konsistenz- und Geometrieverbesserungen unter Apache 2.0. Da Qwen in Image Studio als zusätzlicher Durchgang arbeitet, lohnt sich bei Standbildern auch der direkte Vergleich mit Qwen allein. Offizielle Modellkarte.

Black Forest Labs bietet 4B unter Apache 2.0 sowie API und Playground an. Für 9B gelten andere Bedingungen. Dies ist ein Workflow-Vergleich, keine Qualitätsrangliste aus einem gemeinsamen Benchmark. Offizielle Seite.
![Offizielle Modellseite von FLUX.2 [klein] 4B.](https://airmore.ai/wp-content/uploads/2026/09/minimax-h3-image-studio-review-de-klein.webp)
Fehlerbehebung, Lizenz und NSFW
| Problem | Zuerst prüfen |
|---|---|
| Fehlende oder rote Nodes | ComfyUI und Erweiterung aktualisieren, neu starten und passende UI JSON laden. |
| Bild bleibt fast unverändert | Quellanker im älteren FL2VA-I2I-Workflow prüfen; REF2VA Image Edit ausprobieren. |
| Falsche Person oder Pose | Reihenfolge und Rollen kontrollieren; widersprüchliche Erhaltungswünsche entfernen. |
| Zu wenig Speicher oder sehr langsam | Auf etwa 1 MP, fünf Frames und Batch eins zurückgehen. Modelle, RAM und Offloading vor zusätzlichen Refinern prüfen. |
| Leeres Canvas | examples/ui statt examples/api öffnen. |
| Mehr Pixel, kaum Details | Bei Standardgröße vergleichen und Quelle sowie Prompt überarbeiten. Auflösung ist nicht gleich Treue. |
Die Unlicense der Erweiterung ersetzt nicht die H3-Lizenz. Die Community License schließt EU, Großbritannien, Südkorea und USA aus und verlangt zusätzliche Genehmigung oberhalb von 20 Millionen US-Dollar jährlichem kommerziellem Umsatz. Für den Einsatz in Deutschland oder Österreich ist der EU-Ausschluss daher entscheidend. Comfys FAQ beschreibt einen separaten Lizenzweg; Professional beginnt bei 5.000 USD pro Monat. Das ist kein Image-Studio-Abo und kein lokaler Eurotarif. Kläre Region und Nutzungsumfang vor dem Einsatz. H3-Lizenz · Kommerzielle Lizenz.
NSFW: Lokaler Betrieb ist weder eine offiziell unzensierte Funktion noch eine unbegrenzte Erlaubnis. Hier liegt kein verlässlicher NSFW-Leistungstest vor. H3-Regeln, Hostbedingungen, Einwilligung, Rechte und Beschränkungen schädlicher Inhalte gelten weiterhin.
Häufige Fragen
Ist das Image-01 oder MiniMax Design?
Nein. Gemeint ist astropuzzos H3-Erweiterung für ComfyUI. Preise, API-Parameter und Quoten anderer Produkte lassen sich nicht übertragen.
Geht es ohne starke lokale GPU?
Eine kompatible gemietete GPU kann geeignet sein. Bestätige zuerst Nodes und Gewichte; natives H3 allein garantiert diesen Workflow nicht.
Immer vier Schritte wählen?
Draft eignet sich zum Ausprobieren. Vergleiche ausgewählte Referenzen mit acht Schritten, da sich auch Adapter und Rezept unterscheiden.
Sind Anime und Fotorealismus möglich?
Veröffentlichte Beispiele zeigen beides, aber keine Garantie für jede Pose oder jeden Stil. Teste eine kleine Auswahl vor der Produktion.
Bleibt die Figur im Video identisch?
Nicht automatisch. Trenne Identität und Pose, verwende klare Referenzen und prüfe zuerst einen kurzen Clip.
Für bestehende H3-Nutzer erweitert Image Studio die vorhandene Umgebung sinnvoll. Beginne mit einer Bearbeitung und einem kurzen Video und übernimm nur Referenzen, die einer genauen Prüfung standhalten. Bei Priorität auf schnelle Bildbearbeitung, einfachere Hardware oder andere Lizenzen lohnt zuerst der Vergleich mit spezialisierten Modellen.
Grundlage: Projektdokumentation und zugeordnete öffentliche Erfahrungsberichte, geprüft am 28. September 2026. Kein eigener lokaler GPU-Benchmark oder vollständiger kostenpflichtiger Cloud-Generierungstest. Das Titelbild ist eine redaktionelle Illustration, keine H3-Ausgabe.