MiniMax H3 評測:具備原生音訊的開放權重 AI 影片模型

MiniMax H3 是目前​​最有趣的開放權重 AI 影片版本之一,因為它不會將音訊視為事後的想法。它旨在同時產生影片和原生立體聲音訊,同時也支援更...
schedule
article 10 分鐘閱讀
MiniMax H3 評測:原生音訊 AI 影片模型封面

MiniMax H3 是目前​​最有趣的開放權重 AI 影片版本之一,因為它不會將音訊視為事後的想法。它旨在同時產生影片和原生立體聲音訊,同時也支援更廣泛的 H3 系統中的文字、圖片、影片和音訊引用。

簡短的結論:MiniMax H3 對於開發人員、研究人員和進階 ComfyUI 使用者來說是令人興奮的,但它不是一個輕量級的「在任何遊戲 PC 上下載並執行」模型。模型龐大,完整的2K工作流程涉及託管API元件,社群授權具有重要的地理和商業使用條件。

MiniMax H3 是什麼

MiniMax H3 是 MiniMax 的多模態 AI 影片生成模型。在 Hugging Face 上,它被標記為文字生成影片、圖片生成影片、影片轉影片、文字轉音訊影片、參考音訊影片以及相關的音訊影片生成任務。實際上,它的目標是將場景、其參考及其聲音設計理解為單一生成問題。

MiniMax H3 Hugging Face 模型頁
MiniMax H3 Hugging Face 頁面顯示 33B 模型比例、Safetensors 格式、任務標籤和社群授權元資料。

H3系統被描述為三個部分:H3-Context-IR、H3-Base和H3-Regenerate-2K。 H3-Base 產生 768p 音訊影片輸出,而 2K 輸出則透過使用基本結果和原始上下文的再生工作流程進行處理。這種區別很重要:開放權重很重要,但完整的官方工作流程與簡單的一鍵式本地模型不同。

主要功能與規格

項目 詳細資料
模型類型 開放權重多模態人工智慧影片生成模型
輸入 文字、圖片、影片、音訊和混合引用
輸出 具有 32 kHz 立體聲音訊的影片
持續時間 4 到 15 秒
幀速率 24 幀/秒
解析度 H3-Base主攻768p;2K使用H3-Regenerate-2K
規模 33B級H3-Omni-Transformer
本地框架 記錄了 SGLang、vLLM、擴散器和 ComfyUI 路線
許可證 MiniMax H3 社群授權協議

H3 最強的點之一是原生音訊影片生成。 H3 可以將對話、音效、環境音訊和音樂建模為相同提示結構的一部分,而不是產生無聲剪輯並讓使用者稍後添加聲音。

MiniMax 也發布了兩個面向任務的基礎檢查點。 FL2VA 適用於文字生成影片和第一幀/最後一幀工作流程。 Ref2VA 用於參考驅動生成,其中可為影像、影片和音訊參考指派角色,例如身分、風格、運動、相機行為或語音音調。

如何使用

嘗試類似 H3 生成的最簡單方法是透過 MiniMax 的網路應用程式 Hailuo AI。對於想要在不建立本地 GPU 環境的情況下評估模型的創作者來說,這是最現實的起點。

開發者可以使用MiniMax 影片生成 API。 API 文件包括 H3-Context-IR 和 H3-Regenerate-2K 的端點,如果您想要重現更完整的 2K 工作流程,這些端點非常重要。

MiniMax H3 ComfyUI 工作流程範例
ComfyUI 官方文件介紹了文字生成影片、影像轉影片和參考影片的原生 MiniMax H3 工作流程。

對於本地和基於節點的實驗,ComfyUI 的 MiniMax H3 文件是最平易近人的路線。它包括 T2V、I2V 和 R2V 的模板工作流程,以及擴散模型、文字編碼器、影片 VAE 和音訊 VAE 的模型下載位置。

社群量化與加速版本

MiniMax H3 開放權重後,社群最有價值的進展不是只做展示影片,而是把原本龐大的模型檔案拆成更容易在 ComfyUI 裡使用的版本。Comfy-Org 的 MiniMax-H3 倉庫整理了 pruned INT8 ConvRot、FP8-scaled、BF16、VAE、文字編碼器與 LoRA 等檔案,對一般使用者比直接處理原始 BF16 權重更友善。

目前較實際的 ComfyUI 起步方式,是使用 pruned INT8 ConvRot 的擴散模型,搭配 video VAE、audio VAE,以及量化後的 Qwen3-VL 文字編碼器。ComfyUI Wiki 的 MiniMax H3 教學列出的 pruned INT8 FL2VA / Ref2VA 擴散模型約 19.5GB,完整 BF16 擴散模型約 61.7GB,文字編碼器則從約 14.6GB 到 48GB 都有選擇。

版本 / 元件 改善重點 實用建議
Comfy-Org pruned INT8 ConvRot 降低 ComfyUI 擴散模型檔案大小 目前 T2V / I2V / Ref2V 工作流的合理起點
Qwen3-VL-32B NVFP4 AWQ 文字編碼器 把 BF16 等級的體積降到約 14.6-15.7GB ComfyUI 配方中很常見的平衡選擇
Qwen3-VL-32B INT8 ConvRot 約 25GB,品質保留較多 適合記憶體壓力沒那麼緊的使用者
GGUF Q4 / Q5 文字編碼器 社群常用的低記憶體路線 需要相容的 GGUF loader
Q2 / Q3 或 recovered 8B 路線 更省記憶體但可能犧牲理解與畫面穩定 適合測試,不建議當作預設品質方案

MiniMax H3 的文字編碼器尤其重要。它使用 Qwen3-VL-32B 系列作為文字理解核心,完整 BF16 版約 48GB,而Comfy-Org 的 NVFP4 AWQ 版本約 15GB,是目前 ComfyUI 使用者較容易採用的選項。如果工作流還沒開始 denoise 就報錯,文字編碼器檔案位置與檔名通常是第一個該檢查的地方。

加速方面,LightX2V 的 MiniMax H3 TurboLarryvrh 的 MiniMax-H3 Turbo LoRA主打 4 到 8 steps 生成;FastVideo 的FastH3 推論程式碼則在少步數蒸餾與 sparse attention 方向上做了更多嘗試。要注意的是,加速版不是單純的畫質升級。步數越少越快,但動作細節、音訊穩定性與銳利度仍需要測試與調整。

比較穩的做法是先用官方或 Comfy-Org 的標準工作流跑通,再加入 Turbo LoRA。4-step 適合快速預覽,硬體允許時 6 到 8 steps 通常更穩。LoRA 強度也建議先接近作者建議值,不要一開始同時改太多參數。

Pinokio 與 Wan2GP:更容易低 VRAM 測試

MiniMax H3 也開始能透過安裝器型工具更輕鬆地測試。Pinokio是一款可用腳本安裝與啟動 AI 工具的桌面啟動器,像minimax-h3-pinokio這類社群方案,目標就是降低手動配置 ComfyUI 與模型檔案的門檻。

對低 VRAM 使用者來說,更值得注意的是WanGP / Wan2GP。它現在不只支援 Wan 系列,也逐漸成為可測試 MiniMax H3、LTX、Hunyuan Video、Qwen Image、Flux 等模型的綜合型 Web UI。它提供模型管理、記憶體設定檔、量化文字編碼器選項與後處理功能,對本機測試更友善。

WanGP 中的 MiniMax H3 會區分 FL2VA 與 Ref2VA。FL2VA 適合文字生成影片與音訊、首幀、尾幀或首尾幀控制;Ref2VA 則適合用參考圖片、參考影片或參考音訊來引導角色、場景、動作或聲音。H3 的參考素材更像是生成時的上下文提示,不一定等於逐幀鎖定。

低 VRAM 報告需要看具體設定。WanGP 文件與 GitHub 討論中,已經可以看到 RTX 3070 8GB、RTX 4060 / 4060 Ti 16GB 等顯示卡的測試案例,但解析度、秒數、offload、CPU RAM 與 SSD 都會大幅影響速度。短 480p 影片可能能跑,720p 以上或更長片段仍然會很吃時間。

如果只是想確認自己的電腦能不能跑 H3,Pinokio 或 WanGP 是比手動組完整 ComfyUI 更實際的入口。若要用於正式製作,最好記錄每次使用的擴散模型、文字編碼器、VAE、LoRA、sampler、steps、解析度與記憶體設定檔,避免之後無法重現結果。

本地部署與硬體

MiniMax H3 是開放權重的,但它並不小。官方 SGLang 範例使用多 GPU 服務命令,Hugging Face 討論很快就充滿了有關 16GB PC、雙 RTX 3090 設定或工作站 GPU 是否可以運行它的問題。

早期第三方分析估計,當包含文字編碼器、轉換器、影片 VAE 和音訊 VAE 時,單一 BF16 管道的大小約為 144GB。 ComfyUI 的路線使用了量化文件,例如 int8 擴散模型和 NVFP4/AWQ 文字編碼器,因此本地障礙應該會有所改善,但使用者仍然應該期待嚴格的硬體和儲存要求。

如果您還不熟悉大型本機 AI 模型,請先從 Hailuo AI 或 API 存取權開始。如果您對 ComfyUI 感到滿意,請先從官方 T2V 範本開始,然後再嘗試參考大量的 R2V 工作流程,因為參考影片和音訊輸入會迅速增加複雜性。

品質、音訊和提示

對 H3 來說,品質不僅僅在於銳利的畫面。好的結果需要時間一致性、可信的物體運動、穩定的角色、清晰的攝影機運動以及適合視覺事件的音訊。這就是為什麼 H3 提示受益於按時間順序排列的動作語言。

微弱的提示說「一個人穿過一座城市」。更強的 H3 提示解釋了運動節拍、物理因果、攝影機路徑、燈光和結束畫面。

A woman in a red coat walks slowly through a narrow neon-lit alley after rain. Each step touches a shallow puddle, sending small ripples across the reflected signs. The camera tracks beside her at waist height, then stops as she turns toward the lens. Ambient audio includes light rain, distant traffic, soft footsteps, and a low synth background.

當音訊很重要時,在編寫提示之前先在腦海中區分對話、音效、氛圍和音樂。 MiniMax 表示對 11 種語言(包括英語和日語)提供穩定的對話支持,但現實世界中的口型同步和語音品質仍需要跨提示、語言、剪輯長度和參考條件進行測試。

媒體與使用者回饋

早期報道對發布開放權重音訊影片模型的野心持正面態度,但對實際發布的內容也持謹慎態度。最重複的警告是地理限制的社群授權證、768p 基本輸出以及本地管道的規模。

Hugging Face 社群的回饋既顯示出興奮,也顯示出實際的擔憂。使用者感謝 MiniMax 發布權重,要求提供更小的版本,質疑許可證限制,討論 ComfyUI 支持,並詢問什麼 GPU 配置可以實際工作。整體情緒最好概括為:令人印象深刻的發布,但尚不便於本地休閒使用。

快速的 ComfyUI 支援是一個有意義的優勢。當創作者可以共享工作流程、調整參考並直觀地測試提示結構時,AI 影片模型會變得更加有用。 H3 以節點為基礎的工作流程可能成為高階使用者了解其優點和限制的主要方式。

商業使用與授權

MiniMax H3 社群授權頁面

將 MiniMax H3 稱為開放權重模型比完全寬鬆的開源模型更安全。 MiniMax H3 社群授權協議包括地理限制、分發要求、商業條款和使用限制。

最重要的細節是排除領土條款。歐盟、英國、韓國和美國不在社群授權的開放重量使用適用範圍內。 MiniMax 表示,受限制區域的組織可以申請單獨的許可證,而 API 存取則遵循不同的模型,因為 MiniMax 可以對託管基礎設施實施保護措施。

商業用途也需要仔細閱讀。此許可證包括有關收入規模、介面歸屬、再分配、安全保障和使用限制的條件。如果您打算將 H3 整合到產品、託管服務或衍生模型工作流程中,請在提交之前直接查看許可證。

比較方式

MiniMax H3 與 Runway、Kling、Luma、Seedance 和類 Sora 系統等線上 AI 影片工具競爭,但定位不同。它的訴求不僅僅是「在瀏覽器中製作出精彩的影片」。它也是一個用於音訊影片生成的開放權重研究和工作流程平台。

型號或服務 最適合 實用視圖
MiniMax H3 音訊影片產生、參考驅動的工作流程、ComfyUI 測試 功能強大,但規模龐大且對許可證敏感
跑道/盧瑪/克林 基於瀏覽器的快速影片產生 對於一般創作者來說更容易
Seedance 風格模型 優質短視頻生成 強大的線上產生基準
FLUX 3 影片 下一代影片、音訊和動作預測方向 隨著可用性的擴展值得關注

如果您專注於更廣泛的圖片和影片模型領域,請參閱我們的 FLUX 3 評論AI 圖片擴展與 Outpainting 工具指南

常見問題

MiniMax H3 完全開源嗎?

不是 Apache/MIT 意義上的寬容。權重是公開的,但模型受 MiniMax H3 社群授權協議管轄,其中包括地理限制、商業條款和使用限制。

它可以產生有音訊的影片嗎?

是的。 H3 專為產生原生音訊影片而設計,包括立體聲音訊。它可以對對話、音效、氛圍和音樂進行建模,作為生成上下文的一部分。

我可以在普通遊戲電腦上運行它嗎?

完整版本並不適合一般電腦輕鬆執行。該模型很大,官方範例和社群討論都指向多 GPU 或高度最佳化的工作流程。 ComfyUI 量化文件可能會降低門檻,但這仍然是一個高級設定。

本地模型是否產生2K影片?

H3-Base 以 768p 輸出為中心。 2K 工作流程使用 H3-Regenerate-2K 和 API 元件。將完整 2K 輸出視為更複雜的工作流程,而不是簡單的本地切換。

ComfyUI 支援 MiniMax H3 嗎?

是的。 ComfyUI 的文檔包括文字生成影片、圖片生成影片和參考生成影片的本機工作流程,以及模型檔案放置指南。

可以商用嗎?

有可能,但僅限於授權條款。在商業專案中使用H3之前,您需要檢查地理、收入規模、歸屬、再分配、安全性和使用限制。

參考

總結

MiniMax H3 是一個真正重要的 AI 影片模型版本,因為它超越了無聲剪輯生成,進入了具有參考驅動工作流程的原生音訊影片生成。對於想要嘗試 ComfyUI、本地模型服務和結構化影片提示的人來說,這尤其有趣。

同時,它也不是一個輕量的本機模型。硬體要求高,2K輸出依賴更複雜的工作流程,許可證需要仔細閱讀。對於大多數創作者來說,最好的第一步是測試 Hailuo AI 或 API 訪問,如果需要更深入的控制,然後再轉向 ComfyUI。

評測標籤

#AI影片生成 #ComfyUI #MiniMax #NSFW #開放權重模型

登入

建立帳戶

密碼必須為 8-20 位,且包含字母和數字

忘記密碼

密碼必須為 8-20 位,且包含字母和數字