MiniMax H3 Image Studioレビュー|ComfyUIで画像生成・参照編集から動画制作へ
MiniMax H3 Image Studioの導入、モデル配布先、必要VRAM、参照画像編集を解説。実例、NSFW・商用利用の制限、H3動画へつなぐ手順も比較します。
MiniMax H3で動画を作っているなら、キャラクターや商品、背景の参照画像も同じComfyUI環境で用意できると便利です。MiniMax H3 Image Studioは、動画モデルH3の仕組みを使って静止画を生成し、参照画像に基づく編集も行えるコミュニティ拡張です。
魅力は、すでにあるH3の制作環境を活用できること。一方、MiniMax公式のオンライン画像生成サービスでも、軽量な独立画像モデルでもありません。H3本体と大きなエンコーダーが必要で、細部の描写、正確な文字、人物の完全な同一性まで保証されるわけではありません。
2026年9月28日更新 · コミュニティ拡張 v23.0.0
何ができる?向いているユーザー
開発者はastropuzzo。通常のワークフローは短いフレーム列を生成し、デコード後に静止画を選びます。新しいMiniMax画像モデルを別途学習したものではありません。現行版には4ステップの下書き用と約1MP・8ステップのワークフローがあり、単一フレームや別デコーダーを使う経路は実験的な位置づけです。プロジェクト · 更新履歴。
用途として相性がよいのは、動画用の顔アップ、全身像、背景プレートなどを少数ずつ用意する作業です。商品色や衣装を動画生成前に試す使い方も考えられます。たまにイラストを1枚作るだけなら、このためだけに動画モデル一式を導入する負担は小さくありません。
出力は完成品と決めつけず、動画に使える候補として確認しましょう。顔、手、服の縫い目、ロゴ、物体の数に小さな違和感があると、動かした際に目立つことがあります。

必要スペック・費用・オンライン利用
すべてのワークフローに共通する最低VRAMは示せません。開発者のv23テストはRTX 4090・VRAM 24GB・RAM 64GB。9月26日のユーザー記事ではRTX 4070・VRAM 12GB・RAM 48GBで参照編集を行っています。ただし、これは特定構成での動作例であり、12GBのGPUなら4MPまで快適に動くという保証ではありません。開発者の測定条件 · RTX 4070での作例。
H3を導入済みなら、互換性のある重みとエンコーダーを再利用できます。モデルと出力用のSSD容量を確保し、最初は約1MP、5フレーム、バッチ1で試してください。VRAM不足時はRAMやストレージへの負荷も増えます。「読み込めた」と「快適に繰り返せる」は別です。
| 利用方法 | 費用が発生する部分 | 選ぶ目安 |
|---|---|---|
| ローカルComfyUI | ノード自体に月額料金や画像ごとのクレジット消費はありません。PC、電気、保存容量、必要なライセンスは別です。 | H3用PCをすでに持つ人に向きます。 |
| GPUレンタル | GPU稼働時間、永続ストレージ、場合によっては転送量。料金は事業者ごとに異なります。 | 契約前に当該カスタムノードと重みを導入できるか確認します。 |
| Comfy Cloud | 現行のプラン・従量条件。H3の商用利用権を含むと案内されています。 | H3対応と、このコミュニティ拡張への対応は別に確認が必要です。 |
Comfy Cloudでは対応するH3ワークフローをオンラインで利用できますが、Image Studioをワンクリックで使えることまで確認されたわけではありません。この拡張を使う場合は、ノード、モデル、ライセンスの対応範囲をホストに確認してください。リポジトリのAPI用JSONはComfyUIクライアント向けであり、別売りの「MiniMax Image Studio API」ではありません。採用できた参照画像1枚あたりの費用には、失敗分と環境構築時間も含めて考えると実用的です。
モデルのダウンロードと導入
ComfyUIを0.30.0以降に更新し、古い解説の設定を混ぜず、現行ワークフローから始めます。ComfyUIのH3ガイド · モデル配布先 · Turboアダプター。生成用と参照編集用ではモデルが異なるため、まず必要な方をダウンロードしてください。
| 構成要素 | ファイル・配布先 | ComfyUI内の保存先 |
|---|---|---|
| 画像生成モデル | minimax_h3_fl2va_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| 参照編集モデル | minimax_h3_ref2va_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| テキスト・画像エンコーダー | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | models/text_encoders/ |
| 動画VAE | minimax_h3_video_vae_fp16.safetensors | models/vae/ |
| 生成用8ステップアダプター | minimax_h3_fl2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors | models/loras/ |
| 編集用8ステップアダプター | minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16.safetensors | models/loras/ |
ComfyUI ManagerでMiniMax H3 Image Studioを検索するか、ComfyUIフォルダーが置かれたディレクトリから以下を実行して再起動します。Portable版は内部のComfyUIフォルダーまでパスを調整してください。カスタムノードを入れるだけでは、必要な重みがすべて揃うわけではありません。
cd ComfyUI/custom_nodes
git clone https://github.com/astropuzzo/ComfyUI-MiniMax-H3-Image-Studio.git 最初の1枚を生成・編集する手順
画面上で開く場合はUI JSONを使います。examples/apiのJSONはAPIクライアント用で、通常のキャンバス用として読み込むと正しく表示されないことがあります。以下は開発者が公開している実際のワークフローです。
- 画像生成:8ステップ — H3_IMAGE_GENERATE.json
- 画像編集:8ステップ — H3_IMAGE_EDIT.json
- 画像生成の下書き:4ステップ — H3_IMAGE_DRAFT.json
- 編集の下書き:4ステップ — H3_EDIT_DRAFT.json
- 2枚の参照画像を使う基本ワークフロー — H3_REFERENCE_EDIT.json
まず1枚を生成する
- H3_IMAGE_GENERATE.jsonを開き、各ローダーでFL2VAモデル、Qwenエンコーダー、動画VAE、対応する768p・8ステップのFL2VAアダプターを指定します。
- 予定している動画に合わせて縦横比を選びます。最初は約1MPと推奨5フレームを使い、付属のサンプリング設定を維持します。
- 被写体、構図、光、背景を静止画として記述します。シードを変えて候補を作り、等倍で確認します。
- 採用したPNGとワークフロー、シードを保存します。後で細部を補正する場合も、元画像を残します。
参照画像を固定しすぎずに編集する
- H3_IMAGE_EDIT.jsonを開き、REF2VAモデルと対応する8ステップアダプターを指定し、Load Imageで元画像を選びます。
- 変えたい箇所と残す要素を具体的に書きます。参照転送はまずnativeを使い、実験的なsemantic-onlyは後から比較します。
- 2枚に異なる役割を持たせるならH3_REFERENCE_EDIT.jsonを開き、両方のLoad Imageを埋めます。指示では<Picture 1>、<Picture 2>を区別してください。この基本ワークフローはTurbo編集用とは設定が異なります。
- source_fidelityは付属の0.6付近から始めます。これは保持に関する指示の強さを調整する値で、denoise強度ではありません。狙った変更だけでなく、勝手に変わった部分も確認します。
付属の768p・8ステップ設定では、動画/音声shiftがFL2VAで6/3、REF2VAで12/3です。モデル、アダプター、設定を一組で合わせてください。ステップ数だけ8から4に変えても、4ステップ用の構成にはなりません。通常の静止画出力には動画VAEを使いますが、音声VAEは不要です。動画生成側では音声VAEも必要になる場合があります。

参照画像をMiniMax H3の動画生成につなぐ
連携の中心は特殊な形式ではなく、完成したPNGの再利用です。他モデルで作った画像と同様にH3へ渡せます。Image Studio由来という理由だけで人物の保持率が高くなるという比較結果は示されていません。動画側の全体像はMiniMax H3のレビューを参照してください。
- 最初に画像の役割を決めます。その構図を冒頭フレームとして動かすならImage-to-Video/FL2VA。人物、衣装、画風を別の場面に反映させるならReference-to-Video/REF2VAです。
- 1つの視点が明確な画像を書き出します。三面図を冒頭フレームにすると複数の人物が並ぶ映像になりかねません。必要なら各ビューを切り分けて参照にします。
- 該当するH3のネイティブ動画テンプレートを開き、PNGを読み込み、参照の役割を明記します。静止画ワークフローの保存形式だけ変えても動画にはなりません。
- 短いクリップと単純な動作で試します。動画テンプレートに必要な動画・音声コンポーネントを揃えます。ComfyのネイティブH3動画ガイドは16:9の初期サイズとして1344×768を示しており、実験的な4MP静止画設定をそのまま移さないようにします。
- 顔の同一性、動作、不要な文字、見切れを確認してから、尺、参照枚数、カメラワークを増やします。画像側と動画側のシード・設定は分けて記録してください。
参照画像と動画に使えるプロンプト例
以下は用途に合わせて書き換えるための例で、実測結果を示すものではありません。
動画に使うキャラクター参照
A single full-body reference image of an adult explorer in a teal raincoat and brown boots, standing neutrally against a plain light-gray background. The entire figure is visible, with relaxed hands and unobstructed facial features. Soft even studio lighting, realistic proportions, no text, no collage. 詰め込んだ設定画より、単一視点の方が確認しやすくなります。顔の細部が必要なら別の視点を個別に生成します。
商品写真の一部を編集
Use <Picture 1> as the source product. Change only the ceramic cup colour from white to deep blue. Retain the handle shape, camera angle, wooden tabletop and soft side lighting. Output one product photograph, with no additional objects or lettering. まずロゴのないテスト商品で試しましょう。色だけでなく形、材質、反射、比率も確認します。
2枚の参照に役割を分ける
Use <Picture 1> for the adult character identity, hairstyle and clothing. Use <Picture 2> only for the standing body pose. Place the character against a plain gray background. Preserve the face and outfit from <Picture 1>; visibly adopt the pose from <Picture 2>. Output a single image, not a comparison sheet. Picture 2にポーズを任せる場合、Picture 1のポーズを維持する指示は入れないようにします。
採用した冒頭画像を動かす
Animate this opening image into a short continuous shot. The adult explorer slowly turns toward the window and lifts one hand. The camera stays still. Preserve the face, teal coat and room layout. Gentle fabric movement, natural timing, no cuts and no on-screen text. これはImage Studioではなく動画テンプレートに入れる例です。最初は単純な動きにすると原因を切り分けやすくなります。
画質とメディア・ユーザーの実例
8月15日のTechnoEdgeで写真家の西川和久氏は、文生画像、衣装の色変更、2枚の参照を使う編集を紹介しました。活用の幅を評価する一方、Krea 2やZ-Imageなど画像専用モデルに対して細部が弱いとも述べています。当時の設定を現在のv23標準設定と混同しないことが大切です。実使用記事。
9月26日のかみもと氏の記事には、RTX 4070で2枚の参照から作ったアニメキャラクターの設定画や場面変更の例があります。全身像のぼやけや、画風が完全には再現されない点にも言及しています。制作前の試行には参考になりますが、厳密な設定画の品質保証ではありません。ユーザーの作例。
開発者のv23比較は、固定したプロンプトとシードを用い、不具合も残して公開されています。衣装やポーズの変更はできても、他の要素が完全に保たれるわけではなく、フレームを増やしても常に改善するとは限りません。4文字の看板が読めた例だけで日本語の長文組版まで評価できません。商品ラベルや小さな文字は1字ずつ確認し、仕上げの文字は通常の編集ソフトで加える方法も有効です。測定と比較画像。

| 開発者の測定例 | 基本20ステップ | Turbo 8ステップ | Turbo 4ステップ |
|---|---|---|---|
| 人物・1024×1024・seed 105 | 10.87秒 | 7.31秒 | 4.41秒 |
| ジャケット編集・1440×1440・seed 205 | 25.04秒 | 13.88秒 | 13.26秒 |
RTX 4090・24GB環境での個別の観測値であり、本站のベンチマークや平均値ではありません。モデルの読み込み、キャッシュ、切り替え、保存も影響します。任意のQwen refinerは再生成による編集で、細部と一緒に顔や光が変わることもあります。劣化のない復元と考えず、等倍で比較してください。
Qwen Image Edit・FLUX.2 [klein]との比較
| 選択肢 | 選ぶ理由 | 主な注意点 |
|---|---|---|
| MiniMax H3 Image Studio | 既存のH3環境を参照画像の準備から動画制作まで使いたい。 | 大きな動画モデル一式とコミュニティ設定、H3の利用条件が必要。 |
| Qwen-Image-Edit-2511 | 複数人物や材質変更を含む、画像編集そのものを重視したい。 | 別のモデル構成が必要で、編集後の確認は欠かせない。 |
| FLUX.2 [klein] 4B | 比較的小さい画像専用モデルで生成・編集したい。 | 画風や参照への反応は異なるため、自分の素材で比較する。 |
Qwenのモデルカードでは、一貫性や幾何的な編集の改善が紹介されています。ライセンスはApache 2.0。Image StudioのQwen細部補正は追加工程なので、静止画が主な成果物なら単体のQwen編集も比較候補になります。Qwen公式モデルカード。

Black Forest LabsはApache 2.0の4B版と、ホスト型API・プレイグラウンドを提供しています。同じ[klein]でも9B版には異なる条件があります。ここでの比較は用途の違いであり、同条件の画質ランキングではありません。FLUX.2 [klein]公式ページ。
![FLUX.2 [klein] 4Bの公式モデルページ。](https://airmore.ai/wp-content/uploads/2026/09/minimax-h3-image-studio-review-ja-klein.webp)
トラブル対策・商用利用・NSFW
| 困ったこと | 最初に確認する点 |
|---|---|
| 赤いノード・ノード不足 | ComfyUIと拡張を更新し、再起動後に対応するUIワークフローを読み込み直す。 |
| 元画像からほとんど変わらない | 古いFL2VA I2Iで冒頭画像を固定していないか確認し、REF2VAのImage Editを使う。 |
| 人物やポーズが違う | 参照順序を確認し、各画像の役割を明示。矛盾する保持指示を削る。 |
| メモリ不足・極端に遅い | 約1MP・5フレーム・バッチ1に戻す。refinerを追加する前にモデル、RAM、オフロードを確認。 |
| JSONを開いても空白 | examples/apiではなくexamples/uiを使用する。 |
| 大きくしても細部が悪い | 高解像度と忠実度は別。標準サイズで比較し、元画像と指示を見直す。 |
拡張コードのUnlicenseと、H3モデルのライセンスは別です。H3 Community LicenseはEU、英国、韓国、米国を対象地域から除外し、商用製品・サービスの年間売上が2,000万米ドルを超える場合などに別途許諾を求めています。「完全に自由なオープンソース」とは書けません。ComfyのFAQは地域・売上条件と別契約の窓口を案内しており、Professionalは月額5,000米ドルからです。これは日本円のImage Studio月額プランではなく、別の商用ライセンスです。用途と地域に応じた適用範囲を確認してください。H3ライセンス · 商用ライセンス案内。
NSFWについて、ローカル実行は公式の「無検閲」機能や無制限の許可を意味しません。ここで確かなNSFW性能テストは確認されていません。H3の利用規約やホストの規則は引き続き適用され、技術的に生成できるかとは別に、同意、権利、有害な内容への制限を守る必要があります。
よくある質問
Image-01やMiniMax Designとは同じですか?
別物です。このレビューはastropuzzoによるH3用ComfyUI拡張を扱っています。他のMiniMax製品の料金、API設定、アカウント上限を流用しないでください。
高性能GPUがないと使えませんか?
対応するGPUレンタル環境が選択肢になりますが、この拡張とモデルを導入できるか事前確認が必要です。H3対応クラウドだからといって、このワークフローまで動くとは限りません。
4ステップを常用してよいですか?
候補出しには対応するDraftワークフローが便利です。採用候補では8ステップとも比べましょう。アダプターと設定が変わるため、速度だけでなく結果も変わります。
アニメと実写の両方に使えますか?
両方の公開作例があります。ただし、すべての画風やポーズで同じように成功するという意味ではありません。制作に入る前に少数の素材で試してください。
動画でもキャラクターは完全に同じになりますか?
自動的には保証されません。人物、ポーズ、画風の参照を整理し、明瞭な画像で短い動画を確認しましょう。画像をどのモデルで作ったか以上に、参照のわかりやすさが重要です。
H3をすでに使う制作者には、Image Studioは環境を広げる実用的な選択肢です。まず1枚の参照編集と短い動画で確かめ、等倍確認に耐える素材を採用してください。画像編集だけの速さ、軽い構成、別のライセンスを優先するなら、専用画像モデルと比較してからH3一式を導入する方が合理的です。
評価範囲:2026年9月28日時点の公開資料と出典付き実使用報告。本站によるローカルGPUのベンチマークや有料クラウドでの一連の生成テストは行っていません。カバー画像は説明用のイラストで、H3の生成作例ではありません。