YuE2-3B 評測:本機 AI 音樂、Suno 比較與 ComfyUI
YuE2-3B 音樂生成模型值得用嗎?比較 Suno、MiniMax 與 ACE-Step,整理本機部署、顯示記憶體、ComfyUI 工作流程、試聽樣例及非商用授權限制。
YuE2-3B 最有吸引力的地方,是讓你修改作曲本身,而不只是反覆抽一首成品。 它把歌詞與曲風轉成歌聲及伴奏,同時輸出可檢查、可編輯的旋律與和弦樂譜,適合非商用的作曲練習、編曲探索與音樂生成研究。
不過,它還不是毫無限制的「免費 Suno」。模型權重採非商用授權,官方安裝建議使用 24GB NVIDIA 顯示卡,社群對音質的評價也不一致。最高基準分數還涉及從八個候選結果中挑選。購買硬體前,先聽符合自己曲風的音樂範例。
資料更新:2026 年 9 月 16 日。本評測依據已發布的模型、官方文件與具名社群實測;並非 AirMore 自行執行的音訊生成基準測試。
YuE2-3B 能做什麼?先編曲,再合成音訊
官方專案將 YuE2 定位為結合作曲規劃與聲音合成的 3B 級模型。預設先產生包含旋律、和弦的 ABC 樂譜,再輸出 48kHz 立體聲。執行時也需要音訊解碼器,因此「3B」不代表整套系統的記憶體需求。

| 設定 | 實際用途 |
|---|---|
| cot="full" | 規劃旋律與和弦,適合新曲或需要控制和聲的情況。 |
| cot="melody" | 以旋律為依據改變伴奏,適合重新演繹。 |
| cot="off" | 不建立符號樂譜,直接從歌詞與風格生成。 |
| abc=… | 在 full 或 melody 模式輸入現有或修改過的 ABC 樂譜。 |
ABC 是文字記譜格式,不表示能直接理解任意樂譜照片、PDF 或 MIDI。生成文件說明支援的表示方式與中間產物。輸出為立體聲混音,若需要分離人聲、伴奏等音軌,仍須另外處理;最終演奏也不保證完全遵循樂譜。
相較初代 YuE,主要進步是多了可檢查、修改的作曲中間層。不過,修改 ABC 後會重新生成整首錄音,並不保證修改範圍以外的波形保持相同。若原本的歌聲很滿意,務必保留原始音檔。
線上試用、官方下載與社群入口
| 入口 | 類型與用途 |
|---|---|
| 官方試聽頁 | 開發團隊展示歌曲、歌詞、提示詞、樂譜與修改範例;不是付費線上生成服務。 |
| 官方 Hugging Face 模型 | 下載權重、閱讀模型卡;不等於隨時可用的推論 API。 |
| levibrg 線上介面 | 社群提供 Create/Cover、歌詞、風格、規劃模式、seed 與 MP3/FLAC 輸出選項。 |
| mrfakename Space | 社群託管,受 ZeroGPU 額度與服務狀態影響;9 月 16 日無法使用。 |
| audio.cpp WebUI | 在自己的電腦安裝後,以瀏覽器操作;運算仍使用本機硬體。 |

levibrg 的介面於 9 月 16 日可開啟,但這不保證生成一定成功或 GPU 額度充足。社群 Space 並非官方 M·A·P API,也沒有免費服務永遠可用的承諾。網域名稱含 YuE2 的網站,不能直接視為官方。
初次試用可先準備短篇原創主歌與副歌,明確指定語言、樂器和情緒。把提示詞、seed 與樂譜一起保存;使用公開展示站前,先確認上傳錄音的資料處理方式。
能媲美 Suno?先看 Best-of-8 的比較條件
官方 WildSongBench使用 192 組提示詞自動評分,不是獨立聽眾的盲測。SongBench Avg 越高越好,PER 為音素錯誤率,越低代表該評估中的歌詞對齊越好。
| 模型/設定 | SongBench Avg ↑ | PER ↓ |
|---|---|---|
| YuE2, best-of-8 | 6.9632 | 9.79% |
| Suno v5 | 6.8721 | 8.10% |
| YuE2, 標準・二選一 | 6.7316 | 8.44% |
| Suno v6 | 6.5562 | — |
| MiniMax Music 3 | 6.2830 | 6.27% |
| ACE-Step 1.5 | 6.0118 | 7.46% |
| YuE 1 | 4.9165 | 36.38% |
標準 YuE2 的結果已經是二選一,Best-of-8 則是八選一。 一般管線呼叫只產生一個候選,篩選是另外的步驟,不能把標準結果稱為 Best-of-1。八次生成也意味著更多運算與試聽時間。
表中兩組 YuE2 數據使用 YuE2-Vae-legacy;一般試聽預設使用 YuE2-Vae。官方指出兩者在指標上的音樂性與感知音質之間有取捨。比較時應同時考慮解碼器、提示詞、候選數與生成設定。
這支持「在特定評估中具有競爭力」,不能推導出所有曲風、人聲或吉他都勝過 Suno。較新的商用版本分數偏低,也不代表所有使用情境都退步。
真實使用心得:控制力有進步,音質仍有取捨
kun432 的 Zenn 紀錄提供 Colab L4 安裝、生成日誌與音樂連結。該環境約花四分鐘生成,尖峰 VRAM 約 9GB;日語範例仍出現讀音問題。作者明確表示未用過 Suno,因此不能把它當成 Suno 對照實測。

asfdrwe 的 Qiita 文章記錄 Fedora 44、Radeon RX 7800 XT 與 audio.cpp Q4 的組合,包含 HIP 編譯方式與日語偶像曲範例。這證明的是特定 AMD 環境可行,不是所有 Radeon 都獲官方保證;早期模型載入參數也曾更動。
初期 Reddit 討論中,GreyScope 回報在 4090 執行;martinerous 則形容範例有顆粒狀「AI sand」雜訊,Sindre_Lovvold 對重搖滾/金屬吉他及曲風還原不滿。後續翻唱討論則有高度正面的體驗。它們使用不同設定、曲風和篩選方式,不代表整體成功率。
試聽時要注意長母音、子音、吉他起音、鈸聲尾韻、段落轉換與結尾。背景音樂要確認沒有不需要的歌聲,歌曲則要逐句核對歌詞。一段銅管逼真,不表示四分鐘編曲都穩定。目前具體證據以開發者及社群紀錄為主,尚不能宣稱已有大型媒體獨立盲測的一致結論。
硬體配置、VRAM 與生成速度
| 執行方式 | 公開配置與數據 | 如何解讀 |
|---|---|---|
| 官方 PyTorch/BF16 | Linux、Python 3.12、支援 BF16 的 NVIDIA GPU,建議 VRAM 24GB、系統 RAM 24GB。 | 建議配置,不表示每次都用滿 24GB。 |
| 官方 RTX 4090 測量 | full 模式:214.85 秒音訊,耗時 71.04 秒;尖峰 11.18GiB。 | 暖機後的生成時間,不含首次下載與安裝。 |
| 較長上下文 | 官方回報尖峰 14.08GiB。 | 仍要替解碼器、長曲與其他程式保留空間。 |
| 社群 GGUF | Q8/Q4、獨立 VAE 與設定、tokenizer 檔案。 | 另一套執行方式,不能直接套用官方 Python 指令。 |
官方模型卡列出本體加預設 VAE 約 7.8GB 的權重;環境、快取與音檔另計。實務上可預留 20–30GB SSD 空間,新電腦以 32GB 系統 RAM 較有餘裕。這是規劃建議,不是官方最低要求。
| audio.cpp 配置 | 音訊長度 | 耗時 | 尖峰 VRAM |
|---|---|---|---|
| BF16 + F32 VAE | 224.96 s | 60.46 s | 12,535 MiB |
| Q8_0 + F16 VAE | 194.84 s | 38.81 s | 8,867 MiB |
| Q4_0 + F16 VAE | 221.12 s | 44.15 s | 7,755 MiB |
上表來自 audio.cpp 維護者的 RTX 5090 長曲測試,各次先暖機,音訊長度並不相同。5090 上的 7,755MiB 尖峰,不是任意 8GB 顯示卡都能成功的保證;還要考慮可用記憶體、運算後端與速度。

已有合適顯示卡,本機生成不需逐首扣服務點數;若只是偶爾做歌而要買整台電腦,仍須計入硬體、電費、維護與重試成本。模型可下載,不代表八次生成的成本是零。
本機部署:官方 Python 與 GGUF 路線
Linux/NVIDIA 官方安裝
依 官方快速入門建立乾淨的 Python 3.12 環境。下列是官方文件的安裝流程,不代表已在所有 GPU 實測。
git clone https://github.com/multimodal-art-projection/YuE.git cd YuE python3.12 -m venv .venv source .venv/bin/activate python -m pip install --upgrade pip python -m pip install . python examples/generate.py --output outputs/first-song 首次執行會下載權重。播放 outputs/first-song/audio.flac,並保留完整輸出目錄。將以下英文原創歌詞範例存為 my_song.py,再執行 python my_song.py;可自行替換歌詞與語言描述,先用短篇測試發音。
from yue2 import YuE2Pipeline with YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B", device="cuda") as pipe: song = pipe( style="English, warm piano pop, 96 BPM, clear lead vocal, " "soft drums, restrained verse, wider final chorus", lyrics="[Verse]\nThe station lights are fading slow\n" "I keep a little hope to go\n\n" "[Chorus]\nOne more morning, one more mile\n" "Carry me home with a quiet smile", cot="full", seed=42, ) song.save_artifacts("outputs/my-song") print(song.truncated) 檢查 song.truncated 及 result.json:即使音檔可以播放,也可能觸及 token 上限。保存樂譜、設定與模型/VAE 版本。樂譜修改及 SheetSage2 轉錄再重新演繹有獨立文件;一般文字生成歌曲不需額外下載 MERT2。
audio.cpp、GGUF 與 AMD
9 月 15 日的 audio.cpp v0.8.0已將 YuE2、SheetSage2 合併至 main,早期「只能用 dev」的說法已過時。選擇符合系統與後端的版本,並從 GGUF 頁面備齊主模型、VAE、設定與 tokenizer,不能只下載單一權重檔。
依當前版本的 CLI/WebUI 模型載入說明操作。Windows CUDA 版也需要對應執行階段套件;AMD 請依 HIP/ROCm 編譯說明。先分辨缺檔、GPU 核心不支援、Torch 不相容或記憶體不足;重抓同一個模型不會解決套件相容性。官方 Python 與 ComfyUI 環境宜分開。
ComfyUI 工作流程:從樂譜編輯到儲存音訊
FL YuE2 自訂節點提供鋼琴捲軸和分階段生成。維護者驗證的環境為 Windows、Python 3.12、Torch 2.11、RTX PRO 6000 Blackwell;其他裝置與 24GB 配置尚未在此整合中驗證,不能把官方 Python 的建議直接當成節點保證。

下載 score_editor_to_song.json(原始 JSON),用 ComfyUI Manager 安裝節點,或用 ComfyUI 本身的 Python 執行以下指令,再重新啟動。可攜版請改用內附的 Python 執行檔。
cd ComfyUI/custom_nodes git clone https://github.com/filliptm/ComfyUI-FL-YuE2.git cd ComfyUI-FL-YuE2 python -m pip install -r requirements.txt - 將 JSON 拖入 ComfyUI,先補齊缺少的節點。
- Load Models 首次載入會下載本體與解碼器到 ComfyUI/models/yue2/,約 7.8GB。
- Piano Roll Score Editor 範例為 8 小節;調整音符與和弦後再生成。
- 依序連接 Piano Roll → Compose → Render Music → Decode Audio → Preview/Save,並共用載入器。保留已接受的中間結果。
- Generate Audio 範例採 32 步,音訊上限 45 秒。先用短曲確認音質再拉長。
- 使用 PreviewAudio 試聽,透過 SaveAudio 儲存音檔,同時保存工作流程與 seed。
這是維護者提供的實際工作流程,不是所有 GPU 都測過的萬用配置。載入失敗先看缺失節點、模型檔與 VRAM,不要把生成成功等同於音質合格。
先保留範例的八小節純音樂樂譜。若要另作新曲,解除樂譜輸入,在 Compose 填入曲風與歌詞,保留 full 規劃。純音樂可留空歌詞,並描述樂器。輸出儲存在 output/audio/YuE2/;45 秒是上限,不是精確時長。降低解碼器 tile_frames 可能減少解碼記憶體,但不能解決所有記憶體不足。此節點包的 SheetSage2 轉錄需另設上游環境;不要把原生 ComfyUI 節點與 FL 節點的模型、設定混用。
值得試聽的官方與社群音樂
| 樣例 | 適合觀察什麼 |
|---|---|
| 官方歌曲、樂譜與編輯展示 | 歌詞、曲風與實際聲音是否一致,以及修改後的差異。 |
| 官方 The Last Train 與 14 種演繹 | 同一素材在不同編曲中的旋律保持程度。 |
| kun432 日語原創範例 | 日語讀音、長音與歌詞完整度。 |
| kun432 日語重新演繹範例 | 旋律、歌聲與伴奏變化;搭配 Zenn 原文設定閱讀。 |
| audio.cpp BF16/Q8/Q4 範例 | 量化後的雜訊、樂器細節與速度取捨。 |
第三方播放器可能要求登入或驗證;以上保留原始來源,沒有重新託管音檔。不要只聽副歌:戴耳機完整聽一遍,再用喇叭確認背景音樂的穩定度;比較時保持音量接近。
與 Suno、MiniMax Music 3、ACE-Step 比較
Suno:便利性、訂閱與下載額度
Suno 的版本紀錄在 9 月 9 日列出 v6、v6 wild、v6 mini。因此官方基準中的 v5 只是歷史比較對象,不是現今所有 Suno 功能的代稱。Suno 適合重視即開即用和整合工作流程的人;YuE2 的優勢是本機與可編輯作曲結構。

價格頁的美國年度方案月均參考為 Pro US$8、Premier US$24,並非按月付款價格,也不是台灣新台幣報價。實際幣別、稅額與計費週期以帳戶結帳頁為準;不要把截圖中的日圓金額視為台灣方案。
依 9 月 3 日下載規則,免費用戶有帳戶終身 7 次試用下載,Pro/Premier 分別每月 20/60 次,Studio 流程另有例外。串流及連結分享仍可用。「免費帳戶完全不能下載」不準確;生成點數、下載次數與商用權利必須分開看。
MiniMax Music 3:規模與授權不同

MiniMax Music 3含 8B 全域語言模型、0.6B 局部語言模型及其他合成元件,支援最長五分鐘、32kHz 立體聲。YuE2 主幹較小,但參數量不能直接推導 VRAM 或音質;單一基準分數也不是所有音樂風格的排名。
可參考 官方 Space及 Music3 Community License。該授權有命名、安全措施與涵蓋年營收超過 US$2,000 萬時的額外授權門檻,不能套用 YuE2 的許可條件。
ACE-Step:本機迭代與硬體彈性

ACE-Step 1.5採 MIT 授權,提供生成、重新演繹和局部重繪等流程。文件區分約 4GB 的 DiT-only 與至少 6GB 的 LM+DiT;較新的 XL 使用 4B DiT,透過卸載/量化最低列 12GB,建議 20GB,不能把小配置要求套到 XL。
重視旋律、和聲中間層可選 YuE2;需要大量本機修改可比較 ACE-Step;想省去安裝時間則考慮線上服務。商業用途要同時評估音質與適用授權。
常見問題
YuE2 是完全開源、可免費商用嗎?
目前第一方程式碼與文件採 Apache 2.0,但 模型權重採 CC BY-NC 4.0。舊發行壓縮檔仍依附帶授權。可下載不等於可無限制商用,付費服務或客戶專案不能直接假定被允許。
8GB 顯示卡能跑嗎?
Q4 數據接近 8GB,但測量卡是 5090。可在現有硬體試驗,不宜據此購買新卡;官方仍建議 24GB NVIDIA。記憶體很緊時,可先比較其他模型。
日語與其他語言唱得準嗎?
官方與 kun432 有日語範例,但不代表讀音零錯誤。中文或其他語言也應用短句逐句試聽,檢查咬字和漏詞,不要直接把一種語言的成果推廣到另一種。
改樂譜後,歌手與其他段落會保持不變嗎?
沒有這項保證。樂譜約束作曲內容,合成仍會產生新錄音,音色、時間位置及伴奏可能變化。保留滿意的原始版本。
為什麼展示曲比第一次生成好?
候選篩選、曲風、提示詞、解碼器和參數都會影響結果。比較時也要計入失敗作品;Best-of-8 不是一次 API 呼叫的品質保證。
支援 NSFW 或露骨歌詞嗎?
官方未提供通用的 NSFW 支援承諾。本機執行不等於有「無審查模式」,線上展示站也有各自規則,應視為未確認行為。
結論:值得試作,但先確認用途與音質
YuE2 把可檢查的旋律、和聲帶進本機音樂生成,對非商用作曲練習、編曲研究和實驗有實質價值。官方與社群範例值得聽,但每首仍須篩選。
若要商業發行、第一次就得到乾淨人聲,或只想一鍵做歌,它未必是最省事的選擇。先在現有硬體用短曲確認音質,滿意後再投入 ComfyUI 與樂譜編輯,不要只憑漂亮的單一分數購買設備。