YuE2-3Bレビュー:ローカルAI作曲・Suno比較・ComfyUIの使い方
YuE2-3Bの音質評価、Suno・MiniMaxとの違い、必要VRAM、ローカル導入、ComfyUIワークフロー、試聴サンプルを解説。非商用ライセンスとBest-of-8の評価条件も確認できます。
YuE2-3Bの魅力は、完成した曲を聴くだけでなく、メロディやコード進行に手を入れられることです。 歌詞と曲調からボーカル・伴奏を生成し、その途中に編集可能な楽譜を挟みます。趣味の作曲、アレンジの研究、ローカル環境での非商用の試作に向いたモデルです。
ただし、「無料で使えるSunoの完全な代替」と考えるのは早計です。重みには非商用ライセンスが適用され、公式の導入手順は24GBのNVIDIA GPUを前提としています。聴感の評価も分かれており、話題の最高スコアは8候補から選んだ結果です。まず公開音源を聴き、自分の作りたい曲に合うかを判断するのがよいでしょう。
更新日:2026年9月16日。公開モデル、公式手順、出典を示したユーザーの実測・感想に基づくレビューです。AirMore独自の音声生成ベンチマークではありません。
YuE2-3Bでできること:歌だけでなく作曲の途中を編集する
YuE2の公式リポジトリでは、歌詞・スタイルから楽譜と音声を生成する3Bクラスのモデルとして説明されています。標準設定ではABC記譜法でメロディとコードを計画し、その後に歌唱と伴奏を合成します。通常の出力は48kHzステレオです。別途音声デコーダーも使うため、3Bという名前だけで必要メモリは判断できません。

| 設定 | 用途 |
|---|---|
cot="full" | メロディとコードを計画。新曲やハーモニーを指定したい場合の出発点。 |
cot="melody" | メロディを軸にして伴奏を変える。カバー向け。 |
cot="off" | 楽譜の計画を省き、歌詞とスタイルから直接生成。 |
abc=... | 自分で用意・編集したABC楽譜をfullまたはmelodyで入力。 |
ABCはテキスト形式の記譜法です。紙の楽譜の写真やPDF、任意のMIDIをそのまま読めるという意味ではありません。対応する表現と出力ファイルは公式生成ガイドに記載されています。生成音声はステレオミックスで、ボーカルと伴奏などのステムが必要なら別途分離処理を行います。楽譜どおりの演奏が厳密に保証されるわけでもありません。
初代YuEからの大きな変化は、作曲内容を明示的に確認・編集できる中間表現です。ただし楽譜の編集後は曲全体を再生成します。「2小節だけ直し、それ以外の波形は完全に維持する」編集とは異なります。気に入った歌声のテイクを残したいときは、元音源を保存しておきましょう。
オンラインで試せる場所と公式リンク
| リンク | 運営・種類 | できること |
|---|---|---|
| YuE2公式デモ | 開発チームの公開デモ | 曲、歌詞、スタイル、楽譜を確認。カバーや編集前後の試聴にも対応。生成サービスの契約ページではない。 |
| Hugging Face:m-a-p/YuE2-3B | 公式モデル配布 | 重みとモデルカードを公開。常時利用可能な推論APIとは別。 |
| mrfakenameのYuE2-3B Space | コミュニティ運営 | ブラウザーで生成するデモ。稼働状況やZeroGPUの割り当てに左右され、9月16日時点では利用できない状態。 |
| audio.cppのWebUI | 自分のPCで動かすコミュニティ実装 | 導入後はブラウザーから操作できる。ただし計算にはローカルのGPUなどを使用。 |
インストール前の確認なら、まず公式デモを聴くのがおすすめです。コミュニティSpaceはオンライン生成の候補ですが、開発元の有料APIや稼働保証のあるサービスではありません。YuE2という名前を使った別のドメインも、公式チームの運営とは限りません。
生成画面を利用できる場合は、短いオリジナル歌詞と、言語・楽器・雰囲気を絞ったスタイルから始めましょう。プロンプト、seed、楽譜をセットで保存すると比較しやすくなります。公開デモに非公開の録音を送る前には、アップロードデータの扱いも確認してください。
別の入口としてlevibrg氏のコミュニティデモを直接開く方法があります。Create/Cover、style、lyrics、楽譜計画、生成品質、seedを選ぶ画面と、MP3・FLACの出力欄があります。9月16日時点で画面にはアクセスできましたが、生成の完了やGPUの残り割り当てまで保証するものではありません。

Suno級という評価は本当?Best-of-8の条件を読む
公式のWildSongBench評価は192件のプロンプトを使った自動評価です。独立した聴取者によるブラインドテストとは異なります。SongBench Avgは高いほど良く、PERは歌詞の音素誤り率で、低いほど良い指標です。
| モデル・設定 | SongBench Avg ↑ | PER ↓ |
|---|---|---|
| YuE2, best-of-8 | 6.9632 | 9.79% |
| Suno v5 | 6.8721 | 8.10% |
| YuE2, 標準・2候補から選択 | 6.7316 | 8.44% |
| Suno v6 | 6.5562 | — |
| MiniMax Music 3 | 6.2830 | 6.27% |
| ACE-Step 1.5 | 6.0118 | 7.46% |
| YuE 1 | 4.9165 | 36.38% |
標準YuE2の行も、すでに2候補から選択した結果です。 Best-of-8は8候補から選びます。通常のパイプライン呼び出しが返す1候補とは条件が違うため、標準行をBest-of-1と呼ぶのは不正確です。8回生成して選ぶなら、生成時間に加えて聴き比べの時間も必要になります。
さらに、表のYuE2はどちらもベンチマーク用のYuE2-Vae-legacyを使用しています。通常の試聴用はYuE2-Vaeです。公式は両者について、指標上の音楽性と知覚的な音質に違いがあると説明しています。比較時はデコーダー、候補数、プロンプト、生成設定を揃える必要があります。
この結果から言えるのは、特定の評価条件で競争力があるということです。あらゆるジャンルで人声やギターがSunoより良い、とまでは言えません。新しい商用モデルの平均点が低い場合も、すべての用途で劣化したことを意味しません。評価指標と、自分が聴いて重視する点を分けて考えましょう。
実際のユーザー評価:導入できたことと音の良さは別
kun432氏のZenn記事には、ColabのL4での導入、生成ログ、試聴用リンクがあります。その環境では生成に約4分、ピークVRAMは約9GBと報告されています。日本語歌唱には発音や読みの違和感もあり、筆者自身がSuno未使用と明記しています。したがって、これはSunoとの直接比較レビューではありません。

asfdrwe氏のQiita記事は、Fedora 44とRadeon RX 7800 XTでaudio.cppのQ4モデルを動かした記録です。HIPのビルド設定と日本語アイドル曲の生成例があり、AMDで試したい人には具体的な参考になります。ただし、あらゆるRadeonの公式動作保証ではありません。記事内でもモデル指定方法の変更が記録されています。
公開直後のRedditスレッドでは、GreyScope氏が4090での動作を報告する一方、martinerous氏はデモの粒状のノイズを「AI sand」と表現し、Sindre_Lovvold氏はハードロック/メタルのギターやジャンル再現に不満を示しています。反対に後日のカバー生成の投稿には強い好意的評価もあります。環境や曲調、候補の選び方が違う個人の感想であり、成功率の統計ではありません。
聴くときは、伸ばした母音、子音、ギターの立ち上がり、シンバルの余韻、サビへの移行、曲の終わりまで確認してください。BGMなら意図しない歌声、歌ものなら歌詞の抜けや読み違いも重要です。金管の一節やサビが良くても、曲全体の編曲が安定しているとは限りません。
現段階では、具体的な検証材料は開発者・コミュニティの投稿が中心です。大手メディアの独立した横断試聴による定評が固まった段階とは言えません。ローカルでの制御性は魅力ですが、作品ごとの選別は必要という評価が妥当です。
必要スペックと生成速度:公式推奨と低VRAM実測を分ける
| 実行方法 | 公開されている条件・数値 | 読み方 |
|---|---|---|
| 公式PyTorch・BF16 | Linux、Python 3.12、BF16対応NVIDIA GPU・VRAM 24GB。モデルカードはシステムRAM 24GBを推奨。 | サポートの出発点。毎回24GBを使い切るという意味ではない。 |
| 公式RTX 4090測定 | full:214.85秒の音声を71.04秒で生成。VRAMピーク11.18GiB。 | ウォーム状態での測定。初回ダウンロードや導入時間とは別。 |
| 公式の長いコンテキストの測定 | VRAMピーク14.08GiB。 | 曲の長さ、デコーダー、他アプリ用の余裕が必要。 |
| コミュニティGGUF | Q8/Q4本体とVAE、設定・トークナイザーファイルを利用。 | 必要メモリを抑えられる場合があるが、別の実装と導入手順。 |
数値の出典は公式モデルカードのリソース表です。本体と標準VAEの重みは合計約7.8GBですが、環境・キャッシュ・生成音声は別途容量を使います。公式の最低条件ではなく実用上の余裕として、SSDの空き20〜30GB以上、新しく用意するPCならRAM 32GBを見込むと扱いやすいでしょう。
8GB近くで動いた数値も、測定機はRTX 5090
| audio.cppの構成 | 生成音声の長さ | 実行時間 | VRAMピーク |
|---|---|---|---|
| BF16 + F32 VAE | 224.96 s | 60.46 s | 12,535 MiB |
| Q8_0 + F16 VAE | 194.84 s | 38.81 s | 8,867 MiB |
| Q4_0 + F16 VAE | 221.12 s | 44.15 s | 7,755 MiB |
出典はaudio.cppメンテナーの長尺生成テストです。各回はサーバーを再起動し、短いウォームアップ後に測定しています。出力時間が異なるため、同一の曲を処理した比較ではありません。Q4の7,755MiBは有望ですが、任意の8GB GPUで同じ処理を完走できる保証ではありません。速度、対応バックエンド、空きメモリも影響します。

対応GPUをすでに持っていれば、ローカル生成に曲ごとのサービスクレジットは不要です。ただし、たまに数曲作るためだけにPCを購入するなら、機材・電気代・設定や失敗のやり直しまで含めて比較しましょう。無料の重みでも8候補を作れば計算量は増えるため、少量利用ではオンライン契約のほうが負担を抑えられる場合があります。
ローカル導入:公式Python版とGGUF版の始め方
Linux・NVIDIA向けの公式クイックスタート
現在の公式リポジトリに沿って、Python 3.12の新しい仮想環境を用意します。以下は公式手順に基づく導入例です。AirMoreが全GPUで推論を実行・検証したという意味ではありません。
git clone https://github.com/multimodal-art-projection/YuE.git cd YuE python3.12 -m venv .venv source .venv/bin/activate python -m pip install --upgrade pip python -m pip install . python examples/generate.py --output outputs/first-song 初回実行では重みがダウンロードされます。完成後はoutputs/first-song/audio.flacを再生し、出力フォルダーを残してください。自分の曲を入力する場合は、次の内容をmy_song.pyとして保存し、仮想環境内でpython my_song.pyを実行します。歌詞は試作向けの短いオリジナル例です。
from yue2 import YuE2Pipeline with YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B", device="cuda") as pipe: song = pipe( style="English, warm piano pop, 96 BPM, clear lead vocal, " "soft drums, restrained verse, wider final chorus", lyrics="[Verse]\nThe station lights are fading slow\n" "I keep a little hope to go\n\n" "[Chorus]\nOne more morning, one more mile\n" "Carry me home with a quiet smile", cot="full", seed=42, ) song.save_artifacts("outputs/my-song") print(song.truncated) 日本語で作る場合はstyleの言語をJapaneseにし、lyricsを短い日本語に置き換えます。ジャンル・楽器・テンポなどの指示と、実際に歌わせる歌詞を分けるのが基本です。最初から相反するジャンルや大量の細かな演出を詰め込まず、サビの盛り上がりなど一つずつ変えると原因を追いやすくなります。
song.truncatedと保存されたresult.jsonも確認しましょう。再生できても途中でトークン上限に達している場合があります。楽譜修正は編集ガイド、音源からのカバーはSheetSage2とYuE2の公式手順を参照してください。通常のテキストからの生成に、MERT2の別ダウンロードは不要です。
GGUF・AMDではaudio.cppの現在のリリースを使う
9月15日のaudio.cpp v0.8.0でYuE2とSheetSage2がmainに統合されました。「devブランチ限定」という初期情報は現在の状況と異なります。OS・バックエンドに合うビルドを選び、GGUF配布ページから本体のQ8またはQ4、VAE、設定・トークナイザーを揃えます。本体のファイルだけでは動きません。
CLIとローカルWebUIを利用できますが、初期のフォルダー指定方式から読み込みオプションが変わっているため、使用バージョンの説明を優先してください。Windows CUDA版では対応するランタイムの展開も必要です。AMDはHIP/ROCm向けのビルド・配布手順を使い、前述の7800 XTの記録は特定環境の参考として扱います。
失敗時は、sidecarの不足、GPUカーネルの非対応、メモリ不足を切り分けましょう。Torchの不整合はモデルを再ダウンロードしても直りません。公式Python版とComfyUIのPython環境を分け、まず短い曲で動作を確認するのが実用的です。
ComfyUIワークフロー:楽譜編集から音声保存まで
FL YuE2 for ComfyUIはピアノロールと段階的な生成ノードを備えています。作者が動作確認した環境はWindows、Python 3.12、Torch 2.11、RTX PRO 6000 Blackwellです。この統合について、他のGPUや24GB構成は未検証と明記されています。公式Python版の推奨条件を、そのまま全カスタムノードの保証にはできません。

score_editor_to_song.json(JSONを開く)を保存します。ComfyUI Managerでノードを導入するか、次をComfyUIが使っているPythonで実行して再起動してください。ポータブル版では、plainなpythonをその環境の埋め込みPythonに置き換えます。
cd ComfyUI/custom_nodes git clone https://github.com/filliptm/ComfyUI-FL-YuE2.git cd ComfyUI-FL-YuE2 python -m pip install -r requirements.txt - JSONを読み込む。 ComfyUIの画面にドラッグします。未導入ノードがあれば実行前に解消します。
- Load Modelsでモデルを準備する。 初回キュー実行時に約7.8GBを
ComfyUI/models/yue2/へダウンロードします。 - 作曲方法を決める。 最初は付属の8小節のインストゥルメンタル楽譜で試せます。新曲なら供給済みの楽譜入力を外し、Composeにstyleとlyricsを入れ、planningは
fullにします。 - 合成してデコードする。 接続は
Piano Roll → Compose → Render Music → Decode Audio → Preview/Saveです。モデルローダーを共有します。付属例の45秒は上限で、必ず45秒になる指定ではありません。 - 保存して次の版を作る。 保存先は
output/audio/YuE2/です。楽譜やプロンプトを変えて再生成し、元のテイクと聴き比べます。
歌なしならlyricsを空にして、styleに楽器構成を書きます。作者は公開ソルバーに合わせたacoustic_steps=32を案内しています。Decode Audioのtile_framesを小さくするとデコーダーのメモリを抑えられますが、すべてのメモリ不足を解消する設定ではありません。このパックの楽譜入力は音源採譜ノードではなく、SheetSage2は別環境です。
Comfy-OrgのYuE2配布という別ルートもあります。まずは一つの統合のモデルとワークフローを揃えましょう。ネイティブノードとFLノードで、重みや設定をそのまま流用できるとは限りません。
試聴しておきたい生成音楽のサンプル
印象的な数秒だけでなく、曲の最後まで聴くと実用性を判断しやすくなります。開発元のデモと、コミュニティの生成結果を分けて挙げます。試聴できることと、自分の作品に自由に再利用できることは別です。
| 試聴リンク | 作成者 | 確認したい点 |
|---|---|---|
| 公式の楽譜付き生成例 | YuE2開発チーム | ABCのメロディと音声の関係。複数の言語・ジャンルを比較。 |
| The Last Train:9段階・14バージョン | YuE2開発チーム | 中国語ポップから英語ジャズへの変化。歌詞・コード・編曲を確認。 |
| kun432氏:日本語の生成曲 | 個人開発者 | 日本語の読み、発音、歌詞とリズムの関係。 |
| kun432氏:日本語曲のカバー実験 | 個人開発者 | 元の生成曲からアレンジがどう変わるか。 |
| audio.cpp Demo 2:full planning | コミュニティ実装の作者 | 同じ公開プロンプト・seedによるBF16、Q8、Q4の比較。 |
自分で比較するなら、オリジナル歌詞とstyleを固定し、各モデルで同じ候補数を生成します。失敗も記録に残し、音量を揃えて聴きましょう。歌声の明瞭さ、歌詞の正確さ、展開の変化、楽器の質感、ノイズを分けて評価すると、「なんとなく良い」より選びやすくなります。
Suno・MiniMax Music 3・ACE-Stepとの比較
| モデル・サービス | 向いている用途 | 費用・ライセンス | 主な注意点 |
|---|---|---|---|
| YuE2-3B | メロディ・コードを編集する非商用のローカル試作 | 曲ごとのモデル利用料なし。機材費は必要。重みはCC BY-NC 4.0。 | 環境構築と音の選別が必要。編集後は曲全体を再生成。 |
| Suno v6系 | ブラウザーでの作曲と統合編集 | 無料枠、Pro、Premier。ダウンロード枠と規約あり。 | クラウドへの依存と持ち出せる曲数の制限。 |
| MiniMax Music 3 | 別系統の公開重みでフル楽曲を生成 | 重みを公開。独自Community Licenseで条件付き商用利用。 | 複数の大型コンポーネント。HFの一つのサイズ表示だけで全体を判断しない。 |
| ACE-Step 1.5/XL | 高速なローカル試作、編集、幅広いハードウェア | MITライセンスのプロジェクト。機材費は必要。 | 標準版とXLでは音質・必要メモリが異なる。 |
Suno:手軽なオンライン制作。ただしダウンロード枠を確認

9月9日の公式更新でv6、v6-wild、無料枠向けのv6-miniが案内されています。公式料金画面の円表示では、年払いの月額相当がPro 1,200円、Premier 3,600円でした。米ドル表示はそれぞれ8ドル、24ドルです。毎月払いの料金ではなく、税金は決済時に確認する形式です。
9月からのダウンロード規定では、無料アカウントは生涯合計最大7曲の試用ダウンロード、Proは月20曲、Premierは月60曲です。Studioの制作フローには別の例外が案内されています。再生やリンク共有は引き続き利用できます。「無料ユーザーは一切ダウンロード不可」とまとめるのは不正確です。生成クレジット、ダウンロード数、商用利用条件を別々に確認しましょう。
MiniMax Music 3:より大きな構成と異なる商用条件

MiniMax Music 3は8BのグローバルLLM、0.6BのローカルLLMと合成系のコンポーネントを組み合わせ、最大5分・32kHzステレオの曲を生成すると説明されています。YuE2の3Bクラスの本体は小さい一方、パラメーター数だけで実行時メモリや聴感の優劣は決まりません。YuE2側のベンチマークで点数が低くても、全用途で劣るとは限りません。
MiniMax公式のMusic 3 Spaceも公開されています。商用導入ではMusic3 Community Licenseの名称表示・安全措置などの条件を確認してください。対象の製品・サービスによる年間売上が2,000万米ドルを超える場合の追加許諾条項もあり、YuE2と同じライセンスではありません。
ACE-Step:試行回数と対応環境を重視する場合の候補

ACE-Step 1.5の導入ガイドはOSやGPU別の手順を提供しています。MITライセンスのプロジェクトで、カバーや部分再生成などの編集も扱えます。標準構成の目安はDiTのみで4GB以上、LMとDiTで6GB以上です。4B DiTのXLは別枠で、オフロード・量子化併用で12GB以上、20GB推奨とされています。小さい構成の条件をXLに当てはめないようにしましょう。
楽譜を介した作曲制御を試したいならYuE2、多くのローカル試作や別の編集方法を試したいならACE-Stepが候補です。環境構築に時間をかけず、統合された制作画面を使いたいならオンラインサービスが扱いやすいでしょう。商用案件では、音の良さとライセンスの両方で選ぶ必要があります。
よくある質問
完全なオープンソースで、商用利用も無料ですか?
現在のリポジトリの自社コード・ドキュメントはApache 2.0ですが、重みはCC BY-NC 4.0です。過去の配布アーカイブには同梱ライセンスが適用されます。重みを入手できることは、顧客向け制作や有料サービスに無条件で使えることを意味しません。
VRAM 8GBのGPUでも使えますか?
Q4の実測は8GBに近い範囲ですが、測定機は5090です。手持ちのGPUで試す材料にはなっても、購入の保証にはなりません。公式のNVIDIA向け手順は24GBを推奨しています。メモリが厳しい場合は、より軽い別モデルも検討できます。
日本語の歌を作れますか?
公式デモとkun432氏の実測に日本語の例があります。ただし、自然な発音を常に保証するものではありません。短い歌詞から始め、漢字の読みや母音の伸ばし方を確認し、歌いにくい言い回しを直してから長い曲に広げましょう。
一部分を直しても、元の歌声や他の区間は維持されますか?
その保証はありません。楽譜は作曲内容を指定しますが、音声は新しい録音として生成されます。同じメロディでも音色、タイミング、伴奏が変わり得るため、気に入ったテイクは必ず別に残してください。
最初の生成がデモほど良くないのはなぜですか?
候補の選別、ジャンル、プロンプト、デコーダー、生成設定が異なる可能性があります。複数候補を聴き比べつつ、失敗も含めて評価しましょう。公開されているBest-of-8の点数は、通常の1回目の出力を保証する数値ではありません。
NSFWや露骨な歌詞には対応していますか?
公開情報に、あらゆるNSFW表現への対応を保証する明確な説明はありません。ローカル実行できることだけで「無制限」とは判断できず、ホスト型デモには独自ルールもあります。未確認の対応を選定理由にするのは避けたほうがよいでしょう。
総評:作曲を編集したい人に有望。まず短い曲から
YuE2の価値は、音声が完成する前にメロディとハーモニーを見て手を加えられる点にあります。趣味の作曲、非商用の編曲実験、音楽生成の研究では、ローカル環境に追加する意味があります。公式デモだけでなくユーザーの音源も聴くと、得意な方向を探しやすくなります。
一方、商用リリース、すぐ1曲欲しい初心者、最初の1回からきれいな歌声が必要な仕事では、第一候補にしにくい面もあります。日本語や目的のジャンルの例を聴いてから、手持ちの環境で短く試してください。納得できる音が出てから、ComfyUIや楽譜編集へ進むのが無理のない使い方です。