MiniMax H3 Image Studio : avis, images ComfyUI et références pour la vidéo
MiniMax H3 Image Studio : installation, modèles, GPU, retouche par références, limites NSFW et méthode pour préparer des images à animer avec H3.
MiniMax H3 Image Studio intéressera surtout les créateurs qui utilisent déjà H3 pour la vidéo et souhaitent préparer personnages, produits et décors dans le même environnement ComfyUI. Cette extension exploite le modèle vidéo pour produire des images fixes et les modifier à partir de références.
Son atout est la réutilisation de votre installation. Ce n’est ni un service officiel de génération d’images en ligne ni un petit modèle indépendant : H3 et son encodeur restent nécessaires. Les détails, le texte exact et la fidélité des personnages doivent être contrôlés.
Mis à jour le 28 septembre 2026 · Extension communautaire v23.0.0
De quoi s’agit-il et à qui s’adresse-t-il ?
Le projet est maintenu par astropuzzo. Le flux habituel produit une courte séquence, décode les images et en sélectionne une. Il ne s’agit pas d’un nouveau modèle d’image entraîné par MiniMax. La version actuelle ajoute des brouillons en quatre étapes et des flux en huit étapes autour de 1 MP. Les variantes à une seule image et les autres décodeurs restent expérimentaux. Dépôt du projet · Historique.
L’usage pertinent est la préparation d’un petit ensemble de références validées : portrait, vue en pied et décor. On peut aussi tester une couleur de produit ou un costume avant l’animation. Pour une illustration occasionnelle, installer toute cette infrastructure vidéo peut être disproportionné.
Considérez chaque sortie comme une proposition. Vérifiez visage, mains, coutures, logos et nombre d’objets avant de l’animer : les défauts discrets peuvent devenir très visibles en mouvement.

Configuration, coût et accès en ligne
Il n’existe pas de minimum universel de VRAM pour tous les workflows. Le développeur a testé v23 avec une RTX 4090 de 24 Go et 64 Go de RAM. Un retour du 26 septembre décrit des retouches avec une RTX 4070 de 12 Go et 48 Go de RAM. C’est une configuration observée, pas une garantie pour toute carte de 12 Go ni pour toutes les sorties 4 MP. Conditions des tests · Retour RTX 4070.
Si H3 est déjà installé, réutilisez les poids et encodeurs compatibles. Prévoyez de l’espace SSD pour modèles et résultats. Le manque de VRAM peut reporter la charge sur la RAM et le stockage. Commencez vers 1 MP, cinq images et un lot unitaire : charger le modèle ne signifie pas pouvoir itérer rapidement.
| Mode | Ce qui est facturé | À vérifier |
|---|---|---|
| ComfyUI local | Pas d’abonnement ni de crédits par image pour les nœuds ; matériel, électricité, stockage et licences éventuelles restent à prévoir. | Plus intéressant avec une machine H3 existante. |
| GPU loué | Durée d’utilisation, stockage persistant et éventuels transferts. | Possibilité d’installer cette extension et ses poids. |
| Comfy Cloud | Abonnement et consommation en vigueur ; droits commerciaux H3 annoncés comme inclus. | Le support de H3 ne prouve pas celui de cette extension. |
Comfy Cloud permet d’utiliser des workflows H3 compatibles en ligne, sans constituer ici une solution Image Studio en un clic vérifiée. Demandez confirmation pour les nœuds personnalisés, les modèles et la licence avant de payer. Les fichiers API JSON du dépôt sont destinés aux clients ComfyUI, pas à une API MiniMax Image Studio distincte. Comparez le coût par référence retenue, en comptant les essais inutilisables et la configuration.
Télécharger les modèles et installer les nœuds
Mettez ComfyUI à jour en version 0.30.0 ou ultérieure et partez d’un workflow récent, sans mélanger d’anciennes recettes. Guide H3 ComfyUI · Modèles · Adaptateurs Turbo. Génération et retouche utilisent des variantes différentes : téléchargez d’abord celle dont vous avez besoin.
| Élément | Fichier ou téléchargement | Dossier ComfyUI |
|---|---|---|
| Modèle de génération | minimax_h3_fl2va_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| Modèle de retouche par références | minimax_h3_ref2va_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| Encodeur texte/vision | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | models/text_encoders/ |
| VAE vidéo | minimax_h3_video_vae_fp16.safetensors | models/vae/ |
| Adaptateur de génération huit étapes | minimax_h3_fl2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors | models/loras/ |
| Adaptateur de retouche huit étapes | minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors | models/loras/ |
Recherchez MiniMax H3 Image Studio dans ComfyUI Manager ou exécutez les commandes depuis le dossier contenant ComfyUI. Adaptez le chemin pour Portable, puis redémarrez. Installer les nœuds ne télécharge pas automatiquement tous les poids.
cd ComfyUI/custom_nodes
git clone https://github.com/astropuzzo/ComfyUI-MiniMax-H3-Image-Studio.git Générer et modifier une première image
Utilisez les fichiers UI JSON pour ouvrir le canevas. Ceux de examples/api sont des requêtes pour clients API et ne contiennent pas sa disposition visuelle. Voici les workflows publiés par le mainteneur :
- Génération en huit étapes — H3_IMAGE_GENERATE.json
- Retouche en huit étapes — H3_IMAGE_EDIT.json
- Brouillon en quatre étapes — H3_IMAGE_DRAFT.json
- Retouche rapide en quatre étapes — H3_EDIT_DRAFT.json
- Retouche de base avec deux références — H3_REFERENCE_EDIT.json
Commencer par une image
- Ouvrez H3_IMAGE_GENERATE.json et sélectionnez FL2VA, l’encodeur Qwen, le VAE vidéo et l’adaptateur FL2VA 768p de huit étapes correspondant.
- Choisissez le format du futur film. Gardez environ 1 MP, cinq images et la recette de calcul fournie pour le premier essai.
- Décrivez le sujet, le cadrage, la lumière et le fond. Changez la graine pour produire quelques candidats, puis examinez-les à pleine taille.
- Enregistrez le PNG choisi, le workflow et la graine. Conservez l’original même si vous retouchez une copie.
Modifier la référence sans la figer
- Ouvrez H3_IMAGE_EDIT.json, choisissez REF2VA et son adaptateur de huit étapes, puis la source dans Load Image.
- Précisez la modification et les éléments à conserver. Commencez par le transport native ; semantic-only est expérimental.
- Pour deux rôles distincts, ouvrez H3_REFERENCE_EDIT.json et renseignez les deux Load Image. Nommez <Picture 1> et <Picture 2> dans le prompt. Ce workflow de base diffère du flux Turbo.
- Gardez source_fidelity proche de 0.6 au départ. Il ajuste les instructions de conservation, pas la force denoise. Vérifiez les changements demandés et ceux qui ne l’étaient pas.
Les recettes 768p de huit étapes utilisent des shifts vidéo/audio 6/3 pour FL2VA et 12/3 pour REF2VA. Associez le bon modèle, le bon adaptateur et la bonne recette. Passer simplement de huit à quatre étapes ne reproduit pas le workflow Draft. Les images fixes utilisent le VAE vidéo, sans nécessiter le VAE audio ; la vidéo complète peut demander les deux.

Passer de l’image de référence à la vidéo H3
Le lien pratique est le réemploi d’un PNG, comme pour une image issue d’un autre modèle. Aucune comparaison publiée n’établit que l’origine Image Studio garantisse une meilleure identité. Notre test de MiniMax H3 décrit l’environnement vidéo.
- Définissez le rôle : Image-to-Video/FL2VA anime la composition de départ ; Reference-to-Video/REF2VA réutilise identité, costume ou style dans une autre scène.
- Exportez une vue nette et unique. Une planche à trois vues utilisée comme première image peut devenir trois personnages dans le film ; séparez les vues si nécessaire.
- Ouvrez le modèle de workflow vidéo H3 adapté, chargez le PNG et précisez sa fonction. Changer l’extension du fichier ne transforme pas un flux d’images en flux vidéo.
- Testez un plan court avec un geste simple et les composants vidéo/audio requis. Le guide natif recommande 1344×768 comme base vidéo H3 16:9 ; ne transposez pas directement un réglage expérimental d’image 4 MP.
- Contrôlez identité, mouvement, texte indésirable et recadrage avant d’ajouter durée, références ou mouvements de caméra. Enregistrez séparément les graines et réglages image et vidéo.
Guide des workflows natifs image-vers-vidéo et références-vers-vidéo.
Prompts pour les références et l’animation
Ces exemples sont des points de départ à adapter, pas des résultats mesurés. Ils restent en anglais pour préserver la syntaxe
Référence de personnage pour un futur plan
A single full-body reference image of an adult explorer in a teal raincoat and brown boots, standing neutrally against a plain light-gray background. The entire figure is visible, with relaxed hands and unobstructed facial features. Soft even studio lighting, realistic proportions, no text, no collage. Une vue neutre est plus simple à examiner. Créez séparément d’autres angles si le visage doit être plus détaillé.
Retoucher un produit
Use <Picture 1> as the source product. Change only the ceramic cup colour from white to deep blue. Retain the handle shape, camera angle, wooden tabletop and soft side lighting. Output one product photograph, with no additional objects or lettering. Commencez avec un objet sans marque et vérifiez forme, matière, reflets et proportions, pas seulement la couleur.
Attribuer deux rôles distincts
Use <Picture 1> for the adult character identity, hairstyle and clothing. Use <Picture 2> only for the standing body pose. Place the character against a plain gray background. Preserve the face and outfit from <Picture 1>; visibly adopt the pose from <Picture 2>. Output a single image, not a comparison sheet. Si Picture 2 fournit la pose, ne demandez pas aussi de garder celle de Picture 1.
Animer la première image validée
Animate this opening image into a short continuous shot. The adult explorer slowly turns toward the window and lifts one hand. The camera stays still. Preserve the face, teal coat and room layout. Gentle fabric movement, natural timing, no cuts and no on-screen text. Placez ce prompt dans le workflow vidéo. Un geste simple facilite le diagnostic.
Qualité et retours d’utilisation
Dans son article TechnoEdge du 15 août, le photographe Kazuhisa Nishikawa montre génération, changement de couleur de vêtements et retouche à deux références. Il apprécie la souplesse, mais observe moins de détail que dans Krea 2 ou Z-Image. Les anciens réglages ne constituent pas les valeurs par défaut de v23. Retour de terrain.
Le billet de Kamimoto du 26 septembre présente des planches de personnages de style anime et des changements de scène sur RTX 4070. Il note aussi des silhouettes un peu floues et un style imparfaitement reproduit. Cela illustre la préproduction, sans garantir des planches rigoureuses prêtes à livrer. Exemples de l’utilisateur.
Le développeur compare v23 avec prompts et graines fixes, défauts compris. Les vêtements et poses changent, mais certains traits dérivent ; davantage d’images ne signifie pas toujours mieux. Un panneau lisible de quatre lettres ne valide pas la typographie. Vérifiez accents, apostrophes et petits caractères ; ajoutez le texte final dans un éditeur classique si sa précision est cruciale. Rapport et comparatifs.

| Exemple du développeur | Base 20 étapes | Turbo 8 étapes | Turbo 4 étapes |
|---|---|---|---|
| Portrait, 1024×1024, graine 105 | 10,87 s | 7,31 s | 4,41 s |
| Veste, 1440×1440, graine 205 | 25,04 s | 13,88 s | 13,26 s |
Observations individuelles sur RTX 4090/24 Go, et non moyenne ou mesure AirMore. Chargement, cache, changement de modèle et enregistrement influent sur la durée. Le raffineur Qwen optionnel est une nouvelle retouche générative, susceptible de modifier visage et lumière. Comparez à 100 %, sans l’assimiler à une restauration sans perte.
Comparaison avec Qwen Image Edit et FLUX.2 [klein]
| Choix | Pourquoi le choisir | Compromis |
|---|---|---|
| MiniMax H3 Image Studio | Réutiliser H3 de la préparation des références à la vidéo. | Ensemble vidéo volumineux et licence H3. |
| Qwen-Image-Edit-2511 | Retouche dédiée de références, groupes ou matériaux. | Autres modèles à charger et contrôle visuel nécessaire. |
| FLUX.2 [klein] 4B | Modèle dédié plus petit, local ou hébergé. | Rendu et traitement des références différents : comparez vos propres ressources. |
La fiche Qwen met en avant cohérence et retouche géométrique sous Apache 2.0. Son raffineur dans Image Studio ajoute une étape ; si l’image fixe est votre objectif principal, comparez aussi Qwen seul. Fiche officielle.

Black Forest Labs propose le 4B sous Apache 2.0 ainsi qu’un accès API/playground. Les conditions du 9B sont différentes. Il s’agit d’un choix de workflow, pas d’un classement issu d’un benchmark commun. Page officielle.
![Page officielle du modèle FLUX.2 [klein] 4B.](https://airmore.ai/wp-content/uploads/2026/09/minimax-h3-image-studio-review-fr-klein.webp)
Dépannage, licence et NSFW
| Symptôme | À vérifier en premier |
|---|---|
| Nœuds absents ou rouges | Mettez ComfyUI et l’extension à jour, redémarrez et rechargez le bon UI JSON. |
| Source presque inchangée | Vérifiez l’ancrage du vieux flux FL2VA I2I ; essayez Image Edit en REF2VA. |
| Mauvaise identité ou pose | Vérifiez ordre et rôle des références ; retirez les demandes contradictoires. |
| Mémoire saturée ou lenteur | Revenez vers 1 MP, cinq images et un lot unitaire ; examinez RAM, modèles et déchargement mémoire avant les raffineurs. |
| Canevas vide | Ouvrez examples/ui plutôt que examples/api. |
| Résolution élevée, détail faible | Comparez au format initial et revoyez source et prompt ; taille et fidélité sont distinctes. |
L’Unlicense de l’extension ne remplace pas la licence H3. La Community License exclut l’UE, le Royaume-Uni, la Corée du Sud et les États-Unis et prévoit une autorisation supplémentaire au-delà de 20 millions USD de revenus commerciaux annuels. Pour une utilisation en France, l’exclusion de l’UE est donc déterminante. La FAQ Comfy décrit une licence séparée, avec Professional à partir de 5 000 USD/mois : ce n’est ni un abonnement Image Studio ni un tarif local en euros. Vérifiez territoire et usage avant déploiement. Licence H3 · Licence commerciale.
NSFW : l’exécution locale ne constitue ni une fonction officielle sans censure ni une permission illimitée. Aucun benchmark NSFW fiable n’est établi ici. Les règles H3 et de l’hébergeur, le consentement, les droits et les restrictions sur les contenus nuisibles restent applicables.
Questions fréquentes
Est-ce Image-01 ou MiniMax Design ?
Non : il s’agit de l’extension H3 d’astropuzzo pour ComfyUI. Les prix, paramètres API et quotas des autres produits ne s’y appliquent pas automatiquement.
Sans GPU puissant, est-ce possible ?
Un environnement GPU loué compatible peut convenir. Confirmez les nœuds et modèles avant paiement : H3 natif ne garantit pas ce workflow.
Faut-il toujours choisir quatre étapes ?
Draft convient aux essais rapides. Comparez une référence retenue avec huit étapes : adaptateur et recette changent aussi.
Anime et rendu réaliste sont-ils possibles ?
Des exemples publics couvrent les deux, sans garantie pour toutes les poses et esthétiques. Testez quelques ressources avant la production.
Le personnage restera-t-il identique en vidéo ?
Pas automatiquement. Séparez identité et pose, utilisez des références lisibles et validez un plan court avant d’aller plus loin.
Pour les créateurs déjà équipés pour H3, Image Studio élargit utilement le même environnement. Commencez par une retouche et un court plan vidéo, puis ne gardez que les références solides à l’inspection. Si vitesse en image fixe, matériel plus simple ou autre licence priment, comparez un modèle dédié avant d’investir.
Périmètre : documentation et retours publics attribués, consultés le 28 septembre 2026. Aucun benchmark GPU local ni génération complète payante dans le cloud n’a été réalisé pour cet article. La couverture est une illustration éditoriale, pas un résultat H3.