MiniMax H3 Image Studio : avis, images ComfyUI et références pour la vidéo

MiniMax H3 Image Studio : installation, modèles, GPU, retouche par références, limites NSFW et méthode pour préparer des images à animer avec H3.

schedule
article 14 min de lecture
MiniMax H3 Image Studio : illustration conceptuelle d’une référence transformée en séquence vidéo

MiniMax H3 Image Studio intéressera surtout les créateurs qui utilisent déjà H3 pour la vidéo et souhaitent préparer personnages, produits et décors dans le même environnement ComfyUI. Cette extension exploite le modèle vidéo pour produire des images fixes et les modifier à partir de références.

Son atout est la réutilisation de votre installation. Ce n’est ni un service officiel de génération d’images en ligne ni un petit modèle indépendant : H3 et son encodeur restent nécessaires. Les détails, le texte exact et la fidélité des personnages doivent être contrôlés.

Mis à jour le 28 septembre 2026 · Extension communautaire v23.0.0

De quoi s’agit-il et à qui s’adresse-t-il ?

Le projet est maintenu par astropuzzo. Le flux habituel produit une courte séquence, décode les images et en sélectionne une. Il ne s’agit pas d’un nouveau modèle d’image entraîné par MiniMax. La version actuelle ajoute des brouillons en quatre étapes et des flux en huit étapes autour de 1 MP. Les variantes à une seule image et les autres décodeurs restent expérimentaux. Dépôt du projet · Historique.

L’usage pertinent est la préparation d’un petit ensemble de références validées : portrait, vue en pied et décor. On peut aussi tester une couleur de produit ou un costume avant l’animation. Pour une illustration occasionnelle, installer toute cette infrastructure vidéo peut être disproportionné.

Considérez chaque sortie comme une proposition. Vérifiez visage, mains, coutures, logos et nombre d’objets avant de l’animer : les défauts discrets peuvent devenir très visibles en mouvement.

Projet communautaire MiniMax H3 Image Studio et modèles requis.
Projet communautaire MiniMax H3 Image Studio et modèles requis.

Configuration, coût et accès en ligne

Il n’existe pas de minimum universel de VRAM pour tous les workflows. Le développeur a testé v23 avec une RTX 4090 de 24 Go et 64 Go de RAM. Un retour du 26 septembre décrit des retouches avec une RTX 4070 de 12 Go et 48 Go de RAM. C’est une configuration observée, pas une garantie pour toute carte de 12 Go ni pour toutes les sorties 4 MP. Conditions des tests · Retour RTX 4070.

Si H3 est déjà installé, réutilisez les poids et encodeurs compatibles. Prévoyez de l’espace SSD pour modèles et résultats. Le manque de VRAM peut reporter la charge sur la RAM et le stockage. Commencez vers 1 MP, cinq images et un lot unitaire : charger le modèle ne signifie pas pouvoir itérer rapidement.

Mode Ce qui est facturé À vérifier
ComfyUI local Pas d’abonnement ni de crédits par image pour les nœuds ; matériel, électricité, stockage et licences éventuelles restent à prévoir. Plus intéressant avec une machine H3 existante.
GPU loué Durée d’utilisation, stockage persistant et éventuels transferts. Possibilité d’installer cette extension et ses poids.
Comfy Cloud Abonnement et consommation en vigueur ; droits commerciaux H3 annoncés comme inclus. Le support de H3 ne prouve pas celui de cette extension.

Comfy Cloud permet d’utiliser des workflows H3 compatibles en ligne, sans constituer ici une solution Image Studio en un clic vérifiée. Demandez confirmation pour les nœuds personnalisés, les modèles et la licence avant de payer. Les fichiers API JSON du dépôt sont destinés aux clients ComfyUI, pas à une API MiniMax Image Studio distincte. Comparez le coût par référence retenue, en comptant les essais inutilisables et la configuration.

Télécharger les modèles et installer les nœuds

Mettez ComfyUI à jour en version 0.30.0 ou ultérieure et partez d’un workflow récent, sans mélanger d’anciennes recettes. Guide H3 ComfyUI · Modèles · Adaptateurs Turbo. Génération et retouche utilisent des variantes différentes : téléchargez d’abord celle dont vous avez besoin.

Élément Fichier ou téléchargement Dossier ComfyUI
Modèle de génération minimax_h3_fl2va_pruned_int8_convrot.safetensors models/diffusion_models/
Modèle de retouche par références minimax_h3_ref2va_pruned_int8_convrot.safetensors models/diffusion_models/
Encodeur texte/vision qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors models/text_encoders/
VAE vidéo minimax_h3_video_vae_fp16.safetensors models/vae/
Adaptateur de génération huit étapes minimax_h3_fl2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors models/loras/
Adaptateur de retouche huit étapes minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors models/loras/

Recherchez MiniMax H3 Image Studio dans ComfyUI Manager ou exécutez les commandes depuis le dossier contenant ComfyUI. Adaptez le chemin pour Portable, puis redémarrez. Installer les nœuds ne télécharge pas automatiquement tous les poids.

cd ComfyUI/custom_nodes
git clone https://github.com/astropuzzo/ComfyUI-MiniMax-H3-Image-Studio.git

Générer et modifier une première image

Utilisez les fichiers UI JSON pour ouvrir le canevas. Ceux de examples/api sont des requêtes pour clients API et ne contiennent pas sa disposition visuelle. Voici les workflows publiés par le mainteneur :

Commencer par une image

  1. Ouvrez H3_IMAGE_GENERATE.json et sélectionnez FL2VA, l’encodeur Qwen, le VAE vidéo et l’adaptateur FL2VA 768p de huit étapes correspondant.
  2. Choisissez le format du futur film. Gardez environ 1 MP, cinq images et la recette de calcul fournie pour le premier essai.
  3. Décrivez le sujet, le cadrage, la lumière et le fond. Changez la graine pour produire quelques candidats, puis examinez-les à pleine taille.
  4. Enregistrez le PNG choisi, le workflow et la graine. Conservez l’original même si vous retouchez une copie.

Modifier la référence sans la figer

  1. Ouvrez H3_IMAGE_EDIT.json, choisissez REF2VA et son adaptateur de huit étapes, puis la source dans Load Image.
  2. Précisez la modification et les éléments à conserver. Commencez par le transport native ; semantic-only est expérimental.
  3. Pour deux rôles distincts, ouvrez H3_REFERENCE_EDIT.json et renseignez les deux Load Image. Nommez <Picture 1> et <Picture 2> dans le prompt. Ce workflow de base diffère du flux Turbo.
  4. Gardez source_fidelity proche de 0.6 au départ. Il ajuste les instructions de conservation, pas la force denoise. Vérifiez les changements demandés et ceux qui ne l’étaient pas.

Les recettes 768p de huit étapes utilisent des shifts vidéo/audio 6/3 pour FL2VA et 12/3 pour REF2VA. Associez le bon modèle, le bon adaptateur et la bonne recette. Passer simplement de huit à quatre étapes ne reproduit pas le workflow Draft. Les images fixes utilisent le VAE vidéo, sans nécessiter le VAE audio ; la vidéo complète peut demander les deux.

Workflow H3 Image Edit publié par le mainteneur.
Workflow H3 Image Edit publié par le mainteneur.

Passer de l’image de référence à la vidéo H3

Le lien pratique est le réemploi d’un PNG, comme pour une image issue d’un autre modèle. Aucune comparaison publiée n’établit que l’origine Image Studio garantisse une meilleure identité. Notre test de MiniMax H3 décrit l’environnement vidéo.

  1. Définissez le rôle : Image-to-Video/FL2VA anime la composition de départ ; Reference-to-Video/REF2VA réutilise identité, costume ou style dans une autre scène.
  2. Exportez une vue nette et unique. Une planche à trois vues utilisée comme première image peut devenir trois personnages dans le film ; séparez les vues si nécessaire.
  3. Ouvrez le modèle de workflow vidéo H3 adapté, chargez le PNG et précisez sa fonction. Changer l’extension du fichier ne transforme pas un flux d’images en flux vidéo.
  4. Testez un plan court avec un geste simple et les composants vidéo/audio requis. Le guide natif recommande 1344×768 comme base vidéo H3 16:9 ; ne transposez pas directement un réglage expérimental d’image 4 MP.
  5. Contrôlez identité, mouvement, texte indésirable et recadrage avant d’ajouter durée, références ou mouvements de caméra. Enregistrez séparément les graines et réglages image et vidéo.

Guide des workflows natifs image-vers-vidéo et références-vers-vidéo.

Prompts pour les références et l’animation

Ces exemples sont des points de départ à adapter, pas des résultats mesurés. Ils restent en anglais pour préserver la syntaxe . Remplacez le sujet et le décor sans attribuer des rôles contradictoires aux références.

Référence de personnage pour un futur plan

A single full-body reference image of an adult explorer in a teal raincoat and brown boots, standing neutrally against a plain light-gray background. The entire figure is visible, with relaxed hands and unobstructed facial features. Soft even studio lighting, realistic proportions, no text, no collage.

Une vue neutre est plus simple à examiner. Créez séparément d’autres angles si le visage doit être plus détaillé.

Retoucher un produit

Use <Picture 1> as the source product. Change only the ceramic cup colour from white to deep blue. Retain the handle shape, camera angle, wooden tabletop and soft side lighting. Output one product photograph, with no additional objects or lettering.

Commencez avec un objet sans marque et vérifiez forme, matière, reflets et proportions, pas seulement la couleur.

Attribuer deux rôles distincts

Use <Picture 1> for the adult character identity, hairstyle and clothing. Use <Picture 2> only for the standing body pose. Place the character against a plain gray background. Preserve the face and outfit from <Picture 1>; visibly adopt the pose from <Picture 2>. Output a single image, not a comparison sheet.

Si Picture 2 fournit la pose, ne demandez pas aussi de garder celle de Picture 1.

Animer la première image validée

Animate this opening image into a short continuous shot. The adult explorer slowly turns toward the window and lifts one hand. The camera stays still. Preserve the face, teal coat and room layout. Gentle fabric movement, natural timing, no cuts and no on-screen text.

Placez ce prompt dans le workflow vidéo. Un geste simple facilite le diagnostic.

Qualité et retours d’utilisation

Dans son article TechnoEdge du 15 août, le photographe Kazuhisa Nishikawa montre génération, changement de couleur de vêtements et retouche à deux références. Il apprécie la souplesse, mais observe moins de détail que dans Krea 2 ou Z-Image. Les anciens réglages ne constituent pas les valeurs par défaut de v23. Retour de terrain.

Le billet de Kamimoto du 26 septembre présente des planches de personnages de style anime et des changements de scène sur RTX 4070. Il note aussi des silhouettes un peu floues et un style imparfaitement reproduit. Cela illustre la préproduction, sans garantir des planches rigoureuses prêtes à livrer. Exemples de l’utilisateur.

Le développeur compare v23 avec prompts et graines fixes, défauts compris. Les vêtements et poses changent, mais certains traits dérivent ; davantage d’images ne signifie pas toujours mieux. Un panneau lisible de quatre lettres ne valide pas la typographie. Vérifiez accents, apostrophes et petits caractères ; ajoutez le texte final dans un éditeur classique si sa précision est cruciale. Rapport et comparatifs.

Comparaison de vêtements v23 du développeur, pas un test AirMore.
Comparaison de vêtements v23 du développeur, pas un test AirMore.
Exemple du développeur Base 20 étapes Turbo 8 étapes Turbo 4 étapes
Portrait, 1024×1024, graine 105 10,87 s 7,31 s 4,41 s
Veste, 1440×1440, graine 205 25,04 s 13,88 s 13,26 s

Observations individuelles sur RTX 4090/24 Go, et non moyenne ou mesure AirMore. Chargement, cache, changement de modèle et enregistrement influent sur la durée. Le raffineur Qwen optionnel est une nouvelle retouche générative, susceptible de modifier visage et lumière. Comparez à 100 %, sans l’assimiler à une restauration sans perte.

Comparaison avec Qwen Image Edit et FLUX.2 [klein]

Choix Pourquoi le choisir Compromis
MiniMax H3 Image Studio Réutiliser H3 de la préparation des références à la vidéo. Ensemble vidéo volumineux et licence H3.
Qwen-Image-Edit-2511 Retouche dédiée de références, groupes ou matériaux. Autres modèles à charger et contrôle visuel nécessaire.
FLUX.2 [klein] 4B Modèle dédié plus petit, local ou hébergé. Rendu et traitement des références différents : comparez vos propres ressources.

La fiche Qwen met en avant cohérence et retouche géométrique sous Apache 2.0. Son raffineur dans Image Studio ajoute une étape ; si l’image fixe est votre objectif principal, comparez aussi Qwen seul. Fiche officielle.

Fiche officielle et exemples Qwen-Image-Edit-2511.
Fiche officielle et exemples Qwen-Image-Edit-2511.

Black Forest Labs propose le 4B sous Apache 2.0 ainsi qu’un accès API/playground. Les conditions du 9B sont différentes. Il s’agit d’un choix de workflow, pas d’un classement issu d’un benchmark commun. Page officielle.

Page officielle du modèle FLUX.2 [klein] 4B.
Page officielle du modèle FLUX.2 [klein] 4B.

Dépannage, licence et NSFW

Symptôme À vérifier en premier
Nœuds absents ou rouges Mettez ComfyUI et l’extension à jour, redémarrez et rechargez le bon UI JSON.
Source presque inchangée Vérifiez l’ancrage du vieux flux FL2VA I2I ; essayez Image Edit en REF2VA.
Mauvaise identité ou pose Vérifiez ordre et rôle des références ; retirez les demandes contradictoires.
Mémoire saturée ou lenteur Revenez vers 1 MP, cinq images et un lot unitaire ; examinez RAM, modèles et déchargement mémoire avant les raffineurs.
Canevas vide Ouvrez examples/ui plutôt que examples/api.
Résolution élevée, détail faible Comparez au format initial et revoyez source et prompt ; taille et fidélité sont distinctes.

L’Unlicense de l’extension ne remplace pas la licence H3. La Community License exclut l’UE, le Royaume-Uni, la Corée du Sud et les États-Unis et prévoit une autorisation supplémentaire au-delà de 20 millions USD de revenus commerciaux annuels. Pour une utilisation en France, l’exclusion de l’UE est donc déterminante. La FAQ Comfy décrit une licence séparée, avec Professional à partir de 5 000 USD/mois : ce n’est ni un abonnement Image Studio ni un tarif local en euros. Vérifiez territoire et usage avant déploiement. Licence H3 · Licence commerciale.

NSFW : l’exécution locale ne constitue ni une fonction officielle sans censure ni une permission illimitée. Aucun benchmark NSFW fiable n’est établi ici. Les règles H3 et de l’hébergeur, le consentement, les droits et les restrictions sur les contenus nuisibles restent applicables.

Questions fréquentes

Est-ce Image-01 ou MiniMax Design ?

Non : il s’agit de l’extension H3 d’astropuzzo pour ComfyUI. Les prix, paramètres API et quotas des autres produits ne s’y appliquent pas automatiquement.

Sans GPU puissant, est-ce possible ?

Un environnement GPU loué compatible peut convenir. Confirmez les nœuds et modèles avant paiement : H3 natif ne garantit pas ce workflow.

Faut-il toujours choisir quatre étapes ?

Draft convient aux essais rapides. Comparez une référence retenue avec huit étapes : adaptateur et recette changent aussi.

Anime et rendu réaliste sont-ils possibles ?

Des exemples publics couvrent les deux, sans garantie pour toutes les poses et esthétiques. Testez quelques ressources avant la production.

Le personnage restera-t-il identique en vidéo ?

Pas automatiquement. Séparez identité et pose, utilisez des références lisibles et validez un plan court avant d’aller plus loin.

Pour les créateurs déjà équipés pour H3, Image Studio élargit utilement le même environnement. Commencez par une retouche et un court plan vidéo, puis ne gardez que les références solides à l’inspection. Si vitesse en image fixe, matériel plus simple ou autre licence priment, comparez un modèle dédié avant d’investir.

Périmètre : documentation et retours publics attribués, consultés le 28 septembre 2026. Aucun benchmark GPU local ni génération complète payante dans le cloud n’a été réalisé pour cet article. La couverture est une illustration éditoriale, pas un résultat H3.

Étiquettes d'Évaluation

#ComfyUI #MiniMax H3 #MiniMax H3 Image Studio #NSFW #Retouche par images de référence

Se connecter

OU

Créer un compte

Le mot de passe doit contenir entre 8 et 20 caractères et inclure des lettres et des chiffres

OU

Mot de Passe Oublié

Le mot de passe doit contenir entre 8 et 20 caractères et inclure des lettres et des chiffres