YuE2-3B 評測:本機 AI 音樂、Suno 比較與 ComfyUI

YuE2-3B 音樂生成模型值得用嗎?比較 Suno、MiniMax 與 ACE-Step,整理本機部署、顯示記憶體、ComfyUI 工作流程、試聽樣例及非商用授權限制。

schedule
article 11 分鐘閱讀
YuE2-3B 評測:本機 AI 音樂、Suno 比較與 ComfyUI

YuE2-3B 最有吸引力的地方,是讓你修改作曲本身,而不只是反覆抽一首成品。 它把歌詞與曲風轉成歌聲及伴奏,同時輸出可檢查、可編輯的旋律與和弦樂譜,適合非商用的作曲練習、編曲探索與音樂生成研究。

不過,它還不是毫無限制的「免費 Suno」。模型權重採非商用授權,官方安裝建議使用 24GB NVIDIA 顯示卡,社群對音質的評價也不一致。最高基準分數還涉及從八個候選結果中挑選。購買硬體前,先聽符合自己曲風的音樂範例。

資料更新:2026 年 9 月 16 日。本評測依據已發布的模型、官方文件與具名社群實測;並非 AirMore 自行執行的音訊生成基準測試。

YuE2-3B 能做什麼?先編曲,再合成音訊

官方專案將 YuE2 定位為結合作曲規劃與聲音合成的 3B 級模型。預設先產生包含旋律、和弦的 ABC 樂譜,再輸出 48kHz 立體聲。執行時也需要音訊解碼器,因此「3B」不代表整套系統的記憶體需求。

YuE2 官方音樂範例與樂譜編輯展示
YuE2 官方音樂範例與樂譜編輯展示 — 來源
設定 實際用途
cot="full" 規劃旋律與和弦,適合新曲或需要控制和聲的情況。
cot="melody" 以旋律為依據改變伴奏,適合重新演繹。
cot="off" 不建立符號樂譜,直接從歌詞與風格生成。
abc=… 在 full 或 melody 模式輸入現有或修改過的 ABC 樂譜。

ABC 是文字記譜格式,不表示能直接理解任意樂譜照片、PDF 或 MIDI。生成文件說明支援的表示方式與中間產物。輸出為立體聲混音,若需要分離人聲、伴奏等音軌,仍須另外處理;最終演奏也不保證完全遵循樂譜。

相較初代 YuE,主要進步是多了可檢查、修改的作曲中間層。不過,修改 ABC 後會重新生成整首錄音,並不保證修改範圍以外的波形保持相同。若原本的歌聲很滿意,務必保留原始音檔。

線上試用、官方下載與社群入口

入口 類型與用途
官方試聽頁 開發團隊展示歌曲、歌詞、提示詞、樂譜與修改範例;不是付費線上生成服務。
官方 Hugging Face 模型 下載權重、閱讀模型卡;不等於隨時可用的推論 API。
levibrg 線上介面 社群提供 Create/Cover、歌詞、風格、規劃模式、seed 與 MP3/FLAC 輸出選項。
mrfakename Space 社群託管,受 ZeroGPU 額度與服務狀態影響;9 月 16 日無法使用。
audio.cpp WebUI 在自己的電腦安裝後,以瀏覽器操作;運算仍使用本機硬體。
levibrg 社群提供的 YuE2 線上生成介面
levibrg 社群提供的 YuE2 線上生成介面 — 來源

levibrg 的介面於 9 月 16 日可開啟,但這不保證生成一定成功或 GPU 額度充足。社群 Space 並非官方 M·A·P API,也沒有免費服務永遠可用的承諾。網域名稱含 YuE2 的網站,不能直接視為官方。

初次試用可先準備短篇原創主歌與副歌,明確指定語言、樂器和情緒。把提示詞、seed 與樂譜一起保存;使用公開展示站前,先確認上傳錄音的資料處理方式。

能媲美 Suno?先看 Best-of-8 的比較條件

官方 WildSongBench使用 192 組提示詞自動評分,不是獨立聽眾的盲測。SongBench Avg 越高越好,PER 為音素錯誤率,越低代表該評估中的歌詞對齊越好。

模型/設定 SongBench Avg ↑ PER ↓
YuE2, best-of-8 6.9632 9.79%
Suno v5 6.8721 8.10%
YuE2, 標準・二選一 6.7316 8.44%
Suno v6 6.5562
MiniMax Music 3 6.2830 6.27%
ACE-Step 1.5 6.0118 7.46%
YuE 1 4.9165 36.38%

標準 YuE2 的結果已經是二選一,Best-of-8 則是八選一。 一般管線呼叫只產生一個候選,篩選是另外的步驟,不能把標準結果稱為 Best-of-1。八次生成也意味著更多運算與試聽時間。

表中兩組 YuE2 數據使用 YuE2-Vae-legacy;一般試聽預設使用 YuE2-Vae。官方指出兩者在指標上的音樂性與感知音質之間有取捨。比較時應同時考慮解碼器、提示詞、候選數與生成設定。

這支持「在特定評估中具有競爭力」,不能推導出所有曲風、人聲或吉他都勝過 Suno。較新的商用版本分數偏低,也不代表所有使用情境都退步。

真實使用心得:控制力有進步,音質仍有取捨

kun432 的 Zenn 紀錄提供 Colab L4 安裝、生成日誌與音樂連結。該環境約花四分鐘生成,尖峰 VRAM 約 9GB;日語範例仍出現讀音問題。作者明確表示未用過 Suno,因此不能把它當成 Suno 對照實測。

kun432 的 YuE2 安裝紀錄與生成音樂範例
kun432 的 YuE2 安裝紀錄與生成音樂範例 — 來源

asfdrwe 的 Qiita 文章記錄 Fedora 44、Radeon RX 7800 XT 與 audio.cpp Q4 的組合,包含 HIP 編譯方式與日語偶像曲範例。這證明的是特定 AMD 環境可行,不是所有 Radeon 都獲官方保證;早期模型載入參數也曾更動。

初期 Reddit 討論中,GreyScope 回報在 4090 執行;martinerous 則形容範例有顆粒狀「AI sand」雜訊,Sindre_Lovvold 對重搖滾/金屬吉他及曲風還原不滿。後續翻唱討論則有高度正面的體驗。它們使用不同設定、曲風和篩選方式,不代表整體成功率。

試聽時要注意長母音、子音、吉他起音、鈸聲尾韻、段落轉換與結尾。背景音樂要確認沒有不需要的歌聲,歌曲則要逐句核對歌詞。一段銅管逼真,不表示四分鐘編曲都穩定。目前具體證據以開發者及社群紀錄為主,尚不能宣稱已有大型媒體獨立盲測的一致結論。

硬體配置、VRAM 與生成速度

執行方式 公開配置與數據 如何解讀
官方 PyTorch/BF16 Linux、Python 3.12、支援 BF16 的 NVIDIA GPU,建議 VRAM 24GB、系統 RAM 24GB。 建議配置,不表示每次都用滿 24GB。
官方 RTX 4090 測量 full 模式:214.85 秒音訊,耗時 71.04 秒;尖峰 11.18GiB。 暖機後的生成時間,不含首次下載與安裝。
較長上下文 官方回報尖峰 14.08GiB。 仍要替解碼器、長曲與其他程式保留空間。
社群 GGUF Q8/Q4、獨立 VAE 與設定、tokenizer 檔案。 另一套執行方式,不能直接套用官方 Python 指令。

官方模型卡列出本體加預設 VAE 約 7.8GB 的權重;環境、快取與音檔另計。實務上可預留 20–30GB SSD 空間,新電腦以 32GB 系統 RAM 較有餘裕。這是規劃建議,不是官方最低要求。

audio.cpp 配置 音訊長度 耗時 尖峰 VRAM
BF16 + F32 VAE 224.96 s 60.46 s 12,535 MiB
Q8_0 + F16 VAE 194.84 s 38.81 s 8,867 MiB
Q4_0 + F16 VAE 221.12 s 44.15 s 7,755 MiB

上表來自 audio.cpp 維護者的 RTX 5090 長曲測試,各次先暖機,音訊長度並不相同。5090 上的 7,755MiB 尖峰,不是任意 8GB 顯示卡都能成功的保證;還要考慮可用記憶體、運算後端與速度。

audio.cpp 的 BF16、Q8、Q4 速度與顯示記憶體實測表
audio.cpp 的 BF16、Q8、Q4 速度與顯示記憶體實測表 — 來源

已有合適顯示卡,本機生成不需逐首扣服務點數;若只是偶爾做歌而要買整台電腦,仍須計入硬體、電費、維護與重試成本。模型可下載,不代表八次生成的成本是零。

本機部署:官方 Python 與 GGUF 路線

Linux/NVIDIA 官方安裝

官方快速入門建立乾淨的 Python 3.12 環境。下列是官方文件的安裝流程,不代表已在所有 GPU 實測。

git clone https://github.com/multimodal-art-projection/YuE.git cd YuE python3.12 -m venv .venv source .venv/bin/activate python -m pip install --upgrade pip python -m pip install . python examples/generate.py --output outputs/first-song

首次執行會下載權重。播放 outputs/first-song/audio.flac,並保留完整輸出目錄。將以下英文原創歌詞範例存為 my_song.py,再執行 python my_song.py;可自行替換歌詞與語言描述,先用短篇測試發音。

from yue2 import YuE2Pipeline with YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B", device="cuda") as pipe:     song = pipe(         style="English, warm piano pop, 96 BPM, clear lead vocal, "               "soft drums, restrained verse, wider final chorus",         lyrics="[Verse]\nThe station lights are fading slow\n"                "I keep a little hope to go\n\n"                "[Chorus]\nOne more morning, one more mile\n"                "Carry me home with a quiet smile",         cot="full",         seed=42,     )     song.save_artifacts("outputs/my-song")     print(song.truncated)

檢查 song.truncated 及 result.json:即使音檔可以播放,也可能觸及 token 上限。保存樂譜、設定與模型/VAE 版本。樂譜修改SheetSage2 轉錄再重新演繹有獨立文件;一般文字生成歌曲不需額外下載 MERT2。

audio.cpp、GGUF 與 AMD

9 月 15 日的 audio.cpp v0.8.0已將 YuE2、SheetSage2 合併至 main,早期「只能用 dev」的說法已過時。選擇符合系統與後端的版本,並從 GGUF 頁面備齊主模型、VAE、設定與 tokenizer,不能只下載單一權重檔。

依當前版本的 CLI/WebUI 模型載入說明操作。Windows CUDA 版也需要對應執行階段套件;AMD 請依 HIP/ROCm 編譯說明。先分辨缺檔、GPU 核心不支援、Torch 不相容或記憶體不足;重抓同一個模型不會解決套件相容性。官方 Python 與 ComfyUI 環境宜分開。

ComfyUI 工作流程:從樂譜編輯到儲存音訊

FL YuE2 自訂節點提供鋼琴捲軸和分階段生成。維護者驗證的環境為 Windows、Python 3.12、Torch 2.11、RTX PRO 6000 Blackwell;其他裝置與 24GB 配置尚未在此整合中驗證,不能把官方 Python 的建議直接當成節點保證。

FL YuE2 專案展示的 ComfyUI 鋼琴捲軸與節點流程
FL YuE2 專案展示的 ComfyUI 鋼琴捲軸與節點流程 — 來源

下載 score_editor_to_song.json原始 JSON),用 ComfyUI Manager 安裝節點,或用 ComfyUI 本身的 Python 執行以下指令,再重新啟動。可攜版請改用內附的 Python 執行檔。

cd ComfyUI/custom_nodes git clone https://github.com/filliptm/ComfyUI-FL-YuE2.git cd ComfyUI-FL-YuE2 python -m pip install -r requirements.txt
  1. 將 JSON 拖入 ComfyUI,先補齊缺少的節點。
  2. Load Models 首次載入會下載本體與解碼器到 ComfyUI/models/yue2/,約 7.8GB。
  3. Piano Roll Score Editor 範例為 8 小節;調整音符與和弦後再生成。
  4. 依序連接 Piano Roll → Compose → Render Music → Decode Audio → Preview/Save,並共用載入器。保留已接受的中間結果。
  5. Generate Audio 範例採 32 步,音訊上限 45 秒。先用短曲確認音質再拉長。
  6. 使用 PreviewAudio 試聽,透過 SaveAudio 儲存音檔,同時保存工作流程與 seed。

這是維護者提供的實際工作流程,不是所有 GPU 都測過的萬用配置。載入失敗先看缺失節點、模型檔與 VRAM,不要把生成成功等同於音質合格。

先保留範例的八小節純音樂樂譜。若要另作新曲,解除樂譜輸入,在 Compose 填入曲風與歌詞,保留 full 規劃。純音樂可留空歌詞,並描述樂器。輸出儲存在 output/audio/YuE2/;45 秒是上限,不是精確時長。降低解碼器 tile_frames 可能減少解碼記憶體,但不能解決所有記憶體不足。此節點包的 SheetSage2 轉錄需另設上游環境;不要把原生 ComfyUI 節點與 FL 節點的模型、設定混用。

值得試聽的官方與社群音樂

樣例 適合觀察什麼
官方歌曲、樂譜與編輯展示 歌詞、曲風與實際聲音是否一致,以及修改後的差異。
官方 The Last Train 與 14 種演繹 同一素材在不同編曲中的旋律保持程度。
kun432 日語原創範例 日語讀音、長音與歌詞完整度。
kun432 日語重新演繹範例 旋律、歌聲與伴奏變化;搭配 Zenn 原文設定閱讀。
audio.cpp BF16/Q8/Q4 範例 量化後的雜訊、樂器細節與速度取捨。

第三方播放器可能要求登入或驗證;以上保留原始來源,沒有重新託管音檔。不要只聽副歌:戴耳機完整聽一遍,再用喇叭確認背景音樂的穩定度;比較時保持音量接近。

與 Suno、MiniMax Music 3、ACE-Step 比較

Suno:便利性、訂閱與下載額度

Suno 的版本紀錄在 9 月 9 日列出 v6、v6 wild、v6 mini。因此官方基準中的 v5 只是歷史比較對象,不是現今所有 Suno 功能的代稱。Suno 適合重視即開即用和整合工作流程的人;YuE2 的優勢是本機與可編輯作曲結構。

Suno 官方訂閱價格頁,畫面為日圓地區顯示
Suno 官方訂閱價格頁,畫面為日圓地區顯示 — 來源

價格頁的美國年度方案月均參考為 Pro US$8、Premier US$24,並非按月付款價格,也不是台灣新台幣報價。實際幣別、稅額與計費週期以帳戶結帳頁為準;不要把截圖中的日圓金額視為台灣方案。

9 月 3 日下載規則,免費用戶有帳戶終身 7 次試用下載,Pro/Premier 分別每月 20/60 次,Studio 流程另有例外。串流及連結分享仍可用。「免費帳戶完全不能下載」不準確;生成點數、下載次數與商用權利必須分開看。

MiniMax Music 3:規模與授權不同

MiniMax Music 3 官方模型卡
MiniMax Music 3 官方模型卡 — 來源

MiniMax Music 3含 8B 全域語言模型、0.6B 局部語言模型及其他合成元件,支援最長五分鐘、32kHz 立體聲。YuE2 主幹較小,但參數量不能直接推導 VRAM 或音質;單一基準分數也不是所有音樂風格的排名。

可參考 官方 SpaceMusic3 Community License。該授權有命名、安全措施與涵蓋年營收超過 US$2,000 萬時的額外授權門檻,不能套用 YuE2 的許可條件。

ACE-Step:本機迭代與硬體彈性

ACE-Step 1.5 官方專案與安裝資訊
ACE-Step 1.5 官方專案與安裝資訊 — 來源

ACE-Step 1.5採 MIT 授權,提供生成、重新演繹和局部重繪等流程。文件區分約 4GB 的 DiT-only 與至少 6GB 的 LM+DiT;較新的 XL 使用 4B DiT,透過卸載/量化最低列 12GB,建議 20GB,不能把小配置要求套到 XL。

重視旋律、和聲中間層可選 YuE2;需要大量本機修改可比較 ACE-Step;想省去安裝時間則考慮線上服務。商業用途要同時評估音質與適用授權。

常見問題

YuE2 是完全開源、可免費商用嗎?

目前第一方程式碼與文件採 Apache 2.0,但 模型權重採 CC BY-NC 4.0。舊發行壓縮檔仍依附帶授權。可下載不等於可無限制商用,付費服務或客戶專案不能直接假定被允許。

8GB 顯示卡能跑嗎?

Q4 數據接近 8GB,但測量卡是 5090。可在現有硬體試驗,不宜據此購買新卡;官方仍建議 24GB NVIDIA。記憶體很緊時,可先比較其他模型。

日語與其他語言唱得準嗎?

官方與 kun432 有日語範例,但不代表讀音零錯誤。中文或其他語言也應用短句逐句試聽,檢查咬字和漏詞,不要直接把一種語言的成果推廣到另一種。

改樂譜後,歌手與其他段落會保持不變嗎?

沒有這項保證。樂譜約束作曲內容,合成仍會產生新錄音,音色、時間位置及伴奏可能變化。保留滿意的原始版本。

為什麼展示曲比第一次生成好?

候選篩選、曲風、提示詞、解碼器和參數都會影響結果。比較時也要計入失敗作品;Best-of-8 不是一次 API 呼叫的品質保證。

支援 NSFW 或露骨歌詞嗎?

官方未提供通用的 NSFW 支援承諾。本機執行不等於有「無審查模式」,線上展示站也有各自規則,應視為未確認行為。

結論:值得試作,但先確認用途與音質

YuE2 把可檢查的旋律、和聲帶進本機音樂生成,對非商用作曲練習、編曲研究和實驗有實質價值。官方與社群範例值得聽,但每首仍須篩選。

若要商業發行、第一次就得到乾淨人聲,或只想一鍵做歌,它未必是最省事的選擇。先在現有硬體用短曲確認音質,滿意後再投入 ComfyUI 與樂譜編輯,不要只憑漂亮的單一分數購買設備。

評測標籤

#AI 音樂生成 #ComfyUI #GGUF #YuE2-3B

登入

建立帳戶

密碼必須為 8-20 位,且包含字母和數字

忘記密碼

密碼必須為 8-20 位,且包含字母和數字