YuE2-3B: Lokale KI-Musik, Suno und ComfyUI

YuE2-3B im Review: Klangvergleich mit Suno, lokale Installation, VRAM, ComfyUI-Workflow, Musikbeispiele und Grenzen der nichtkommerziellen Lizenz.

schedule
article 13 Min. Lesezeit
YuE2-3B: Lokale KI-Musik, Suno und ComfyUI

YuE2-3B ist vor allem dann interessant, wenn du die Komposition verändern möchtest, statt immer nur einen neuen fertigen Song zu erzeugen. Aus Liedtext und Stilbeschreibung entstehen Gesang und Begleitung sowie eine bearbeitbare Melodie- und Akkordpartitur. Das eignet sich für nichtkommerzielle Songideen, Arrangement-Studien und Forschung zur Musikgenerierung.

Ein uneingeschränktes „kostenloses Suno“ ist es noch nicht. Die Modellgewichte haben eine nichtkommerzielle Lizenz, die offizielle Installation empfiehlt eine NVIDIA-GPU mit 24 GB, und die Meinungen zur Klangqualität gehen auseinander. Der höchste veröffentlichte Wert beruht außerdem auf einer Auswahl aus acht Kandidaten. Höre deshalb Beispiele an, bevor du Hardware kaufst.

Stand: 16. September 2026. Dieser Review beruht auf dem veröffentlichten Modell, der Dokumentation und zugeordneten Community-Tests. Er ist kein von AirMore durchgeführter Audio-Benchmark.

Was YuE2-3B kann und was gegenüber YuE neu ist

Das offizielle Repository beschreibt ein Modell der 3B-Klasse, das musikalische Planung und Audiosynthese verbindet. Standardmäßig entsteht zuerst eine ABC-Partitur mit Melodie und Akkorden, danach Stereo-Audio mit 48 kHz. Ein separater Decoder gehört dazu; die Bezeichnung 3B beschreibt nicht den gesamten Speicherbedarf.

Offizielle YuE2-Seite mit Musikbeispielen und bearbeitbaren Partituren
Offizielle YuE2-Seite mit Musikbeispielen und bearbeitbaren Partituren — Quelle
Einstellung Praktischer Einsatz
cot="full" Plant Melodie und Akkorde; sinnvoller Ausgangspunkt für einen neuen Song.
cot="melody" Nutzt die Melodie als Bezug und lässt die Begleitung variieren.
cot="off" Generiert direkt aus Stil und Text, ohne symbolische Planung.
abc=… Verwendet eine eigene oder bearbeitete ABC-Partitur in full oder melody.

ABC ist eine Textnotation, keine Zusage für beliebige Notenfotos, PDFs oder MIDI-Dateien. Die Generierungsanleitung erklärt unterstützte Formate und Zwischenergebnisse. Die Ausgabe ist ein Stereo-Mix; einzelne Spuren erfordern eine zusätzliche Trennung. Auch eine exakt partiturgetreue Wiedergabe ist nicht garantiert.

Die wichtigste praktische Verbesserung gegenüber dem ersten YuE ist die sichtbare Kompositionsebene. Eine Änderung der ABC-Partitur erzeugt allerdings eine neue vollständige Aufnahme. Audio außerhalb der Änderung bleibt nicht zwingend identisch. Behalte die Originalaufnahme, wenn dir eine bestimmte Gesangsdarbietung gefällt.

Online testen, Beispiele hören und Gewichte herunterladen

Adresse Angebot
Offizielle Demo Songs, Texte, Stile, Partituren und Bearbeitungsbeispiele; kein Generierungsabonnement.
Offizielles Hugging-Face-Modell Gewichte und Modellkarte; keine dauerhaft verfügbare Inferenz-API.
Oberfläche von levibrg Community-Demo mit Create/Cover, Text, Stil, Planung, Seed und MP3/FLAC-Optionen.
Space von mrfakename Community-Angebot mit Verfügbarkeits- und ZeroGPU-Limits; am 16. September nicht verfügbar.
audio.cpp-WebUI Bedienung im Browser nach Installation auf deinem eigenen Rechner.
Community-Oberfläche für YuE2 bei levibrg
Community-Oberfläche für YuE2 bei levibrg — Quelle

Die levibrg-Oberfläche war am 16. September erreichbar. Das garantiert weder erfolgreiche Generierung noch freie GPU-Kapazität. Die Spaces sind keine offizielle M·A·P-API und kein garantiert verfügbarer Gratisdienst. Auch ein YuE2-Domainname belegt keine Zugehörigkeit zum Entwicklerteam.

Beginne mit einer kurzen eigenen Strophe und einem Refrain, einer eindeutigen Sprache sowie wenigen konkreten Instrumenten und Stilangaben. Speichere Prompt, Seed und Partitur zusammen. Prüfe vor dem Upload privater Aufnahmen den Umgang der Demo mit Dateien.

Auf Suno-Niveau? Die Bedingungen von Best-of-8

Der offizielle WildSongBench verwendet 192 Prompts und automatische Bewertung, keinen unabhängigen Blindhörtest. Bei SongBench Avg ist höher besser; PER bezeichnet die Phonemfehlerrate und sollte niedrig sein.

Modell / Einstellung SongBench Avg ↑ PER ↓
YuE2, best-of-8 6.9632 9.79%
Suno v5 6.8721 8.10%
YuE2, Standard / 2 Kandidaten 6.7316 8.44%
Suno v6 6.5562
MiniMax Music 3 6.2830 6.27%
ACE-Step 1.5 6.0118 7.46%
YuE 1 4.9165 36.38%

Schon die Standardzeile für YuE2 wählt aus zwei Kandidaten. Best-of-8 wählt aus acht. Ein normaler Pipeline-Aufruf erzeugt einen Kandidaten; die Auswahl ist ein separater Schritt. Die Standardzeile als Best-of-1 zu bezeichnen wäre falsch. Acht Versuche benötigen auch mehr Rechen- und Hörzeit.

Beide YuE2-Werte nutzen YuE2-Vae-legacy, während für das übliche Anhören YuE2-Vae vorgesehen ist. Das Projekt beschreibt einen Zielkonflikt zwischen gemessener Musikalität und wahrgenommener Klangqualität. Vergleiche daher Decoder, Prompts, Kandidatenzahl und Einstellungen.

Die Tabelle zeigt Wettbewerbsfähigkeit in diesem Protokoll, keine pauschale Überlegenheit bei Stimmen, Gitarren oder Genres. Ein niedrigerer Wert einer neueren kommerziellen Version beweist ebenfalls keine Verschlechterung in jeder Anwendung.

Echte Erfahrungsberichte: Fortschritte und hörbare Grenzen

kun432s Zenn-Test enthält Colab-L4-Installation, Protokolle und Audiolinks. Genannt werden rund vier Minuten Generierungszeit und etwa 9 GB maximaler VRAM in dieser Umgebung. Das japanische Beispiel enthält Aussprache- beziehungsweise Lesefehler. Der Autor hat Suno nach eigener Aussage nicht getestet: Das ist kein direkter Suno-Vergleich.

Installationsprotokoll und YuE2-Musikbeispiele von kun432
Installationsprotokoll und YuE2-Musikbeispiele von kun432 — Quelle

asfdrwes Qiita-Notizen dokumentieren Fedora 44, Radeon RX 7800 XT und audio.cpp mit Q4, einschließlich HIP-Build und japanischem Popsong. Das belegt eine konkrete AMD-Konfiguration, nicht offiziellen Support für jede Radeon. Änderungen der Ladeparameter sind ebenfalls festgehalten.

Im frühen Reddit-Thread berichtet GreyScope vom Betrieb auf einer 4090. martinerous hört körniges „AI sand“-Rauschen; Sindre_Lovvold kritisiert Rock-/Metal-Gitarren und Genre-Treue. Eine spätere Cover-Diskussion fällt deutlich positiver aus. Unterschiedliche Stile, Einstellungen und Auswahlverfahren machen diese Einzelberichte nicht zu einer repräsentativen Erfolgsquote.

Achte auf gehaltene Vokale, Konsonanten, Gitarrenanschläge, Beckenausklänge, Übergänge und Songenden. Bei Hintergrundmusik stören ungewollte Stimmen; bei Liedern zählt jede Textzeile. Ein überzeugender Bläsersatz garantiert kein stabiles vierminütiges Arrangement. Konkrete Belege stammen bisher vor allem von Entwicklern und Nutzern; ein belastbarer Konsens großer Medien aus unabhängigen Hörtests steht noch aus.

Hardware, VRAM und Generierungstempo

Ausführung Veröffentlichte Angaben Einordnung
Offizielles PyTorch, BF16 Linux, Python 3.12, BF16-fähige NVIDIA-GPU; empfohlen sind 24 GB VRAM und 24 GB RAM. Referenzkonfiguration, nicht ständig 24 GB Verbrauch.
Offizielle RTX-4090-Messung full: 214,85 s Audio in 71,04 s; Spitze 11,18 GiB. Nach Aufwärmen, ohne Erstinstallation und Download.
Längerer Kontext Offizielle Spitze 14,08 GiB. Reserve für Decoder und andere Programme einplanen.
Community-GGUF Q8/Q4, VAE sowie Konfigurations- und Tokenizer-Dateien. Andere Laufzeitumgebung mit eigener Anleitung.

Die Modellkarte nennt rund 7,8 GB Gewichte für Hauptmodell und Standard-VAE. Als praktische Reserve sind 20–30 GB freier SSD-Speicher und bei einem Neukauf 32 GB RAM sinnvoll. Das sind Planungshinweise, keine offiziellen Mindestanforderungen.

audio.cpp-Konfiguration Erzeugtes Audio Rechenzeit VRAM-Spitze
BF16 + F32 VAE 224.96 s 60.46 s 12,535 MiB
Q8_0 + F16 VAE 194.84 s 38.81 s 8,867 MiB
Q4_0 + F16 VAE 221.12 s 44.15 s 7,755 MiB

Diese Messungen des audio.cpp-Maintainers stammen von einer RTX 5090 nach einem Aufwärmlauf. Die Ausgabelängen unterscheiden sich; es sind keine identischen Aufnahmen. 7.755 MiB Spitzenverbrauch mit Q4 auf dieser Karte garantieren keinen erfolgreichen Betrieb auf jeder 8-GB-GPU.

audio.cpp-Messungen zu BF16, Q8, Q4, Geschwindigkeit und VRAM
audio.cpp-Messungen zu BF16, Q8, Q4, Geschwindigkeit und VRAM — Quelle

Mit einer vorhandenen passenden GPU fallen lokal keine Dienst-Credits pro Song an. Für gelegentliche Nutzung gehören bei einem Neukauf aber Rechner, Strom, Wartung und verworfene Versuche in die Rechnung. Frei herunterladbare Gewichte machen acht Generierungen nicht rechenkostenfrei.

Lokal installieren: offizielles Python und GGUF

Offizieller Einstieg unter Linux mit NVIDIA

Nutze den offiziellen Schnellstart in einer sauberen Python-3.12-Umgebung. Die Befehle stammen aus der Dokumentation; sie bedeuten nicht, dass AirMore jede GPU getestet hat.

git clone https://github.com/multimodal-art-projection/YuE.git cd YuE python3.12 -m venv .venv source .venv/bin/activate python -m pip install --upgrade pip python -m pip install . python examples/generate.py --output outputs/first-song

Beim ersten Lauf werden Gewichte geladen. Höre outputs/first-song/audio.flac an und behalte den kompletten Ausgabeordner. Speichere das folgende eigene englische Textbeispiel als my_song.py und starte python my_song.py. Ersetze Text und Sprache nach Bedarf, zunächst mit kurzen Zeilen.

from yue2 import YuE2Pipeline with YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B", device="cuda") as pipe:     song = pipe(         style="English, warm piano pop, 96 BPM, clear lead vocal, "               "soft drums, restrained verse, wider final chorus",         lyrics="[Verse]\nThe station lights are fading slow\n"                "I keep a little hope to go\n\n"                "[Chorus]\nOne more morning, one more mile\n"                "Carry me home with a quiet smile",         cot="full",         seed=42,     )     song.save_artifacts("outputs/my-song")     print(song.truncated)

Prüfe song.truncated und result.json: Auch abspielbares Audio kann das Tokenlimit erreicht haben. Bewahre Partitur, Einstellungen und Modell-/VAE-Versionen auf. Die Anleitungen zu Bearbeitung und SheetSage2-Transkription mit anschließendem Cover erklären weitere Abläufe. Normale Text-zu-Musik-Generierung benötigt keinen zusätzlichen MERT2-Download.

audio.cpp, Windows und AMD

audio.cpp v0.8.0 vom 15. September integriert YuE2 und SheetSage2 in main. Frühere Hinweise auf eine zwingende dev-Branch sind damit überholt. Lade aus dem GGUF-Paket Hauptmodell, VAE und die passenden Konfigurations-/Tokenizer-Dateien. Die einzelne Hauptdatei reicht nicht.

Verwende die aktuellen Ladeoptionen von CLI oder WebUI. Windows-CUDA-Pakete benötigen das passende Runtime-Archiv; für AMD gelten die HIP-/ROCm-Hinweise. Unterscheide fehlende Dateien, nicht unterstützte Kernel, Torch-Konflikte und Speichermangel. Halte das offizielle Python-Setup und ComfyUI getrennt und beginne mit einem kurzen Song.

ComfyUI-Workflow: von der Partitur zur Audiodatei

FL YuE2 für ComfyUI bietet einen Piano-Roll-Editor und getrennte Generierungsschritte. Der Maintainer validiert Windows, Python 3.12, Torch 2.11 und RTX PRO 6000 Blackwell. Andere Geräte und 24-GB-Konfigurationen sind für diese Integration nicht validiert. Die Empfehlung der offiziellen Pipeline gilt daher nicht automatisch für jeden Custom Node.

FL-YuE2-Repository mit Piano Roll und ComfyUI-Workflow
FL-YuE2-Repository mit Piano Roll und ComfyUI-Workflow — Quelle

Lade score_editor_to_song.json oder das rohe JSON. Installiere die Nodes über ComfyUI Manager oder mit diesen Befehlen unter ComfyUIs eigenem Python-Interpreter, anschließend neu starten. Bei der portablen Version nimmst du den eingebetteten Interpreter.

cd ComfyUI/custom_nodes git clone https://github.com/filliptm/ComfyUI-FL-YuE2.git cd ComfyUI-FL-YuE2 python -m pip install -r requirements.txt
  1. Ziehe das JSON in ComfyUI und ergänze fehlende Nodes.
  2. Load Models lädt beim ersten Start etwa 7,8 GB nach ComfyUI/models/yue2/.
  3. Bearbeite Noten und Akkorde im Piano Roll Score Editor; das Beispiel enthält acht Takte.
  4. Folge den Verbindungen von Partitur zu Planung und Audio; behalte akzeptierte Zwischenergebnisse.
  5. Das Beispiel verwendet 32 Schritte und höchstens 45 Sekunden Audio. Beginne mit dieser kurzen Probe.
  6. Höre mit PreviewAudio und speichere mit SaveAudio; sichere auch Workflow und Seed.

Ein abgeschlossener Lauf garantiert keine brauchbare Musik. Prüfe Text, Rauschen und Übergänge vor längeren Ausgaben. Bei Ladefehlern zuerst Nodes, Modelldateien und Speicher untersuchen.

Behalte zuerst die instrumentale Partitur mit acht Takten. Für einen neuen Song trennst du diesen Eingang, gibst Stil und Text in Compose ein und behältst full bei. Die Kette lautet Piano Roll → Compose → Render Music → Decode Audio → Preview/Save mit gemeinsamem Loader. Bei Instrumentalmusik bleibt das Textfeld leer. Dateien landen unter output/audio/YuE2/; 45 Sekunden sind eine Obergrenze, keine exakte Länge. Weniger tile_frames können Decoderspeicher sparen, lösen aber nicht jeden Speicherfehler. SheetSage2 benötigt für dieses Paket eine separate vorgelagerte Umgebung. Native ComfyUI-Nodes und FL-Nodes nicht mit beliebigen Modelldateien oder Einstellungen mischen.

Musikbeispiele zum Vergleichen

Beispiel Worauf achten?
Offizielle Songs und Bearbeitungen Zusammenhang zwischen Text, Stil, Partitur und Klang.
The Last Train in 14 Versionen Melodieerhalt bei wechselndem Arrangement.
Japanischer Originalsong von kun432 Aussprache, Vokale und fehlende Wörter.
Japanisches Cover von kun432 Stimme und Begleitung; dazu die Zenn-Einstellungen lesen.
BF16-/Q8-/Q4-Beispiele Rauschen und Instrumentendetails nach Quantisierung.

Externe Player können Anmeldung oder Verifizierung verlangen. Die Links führen zu Originalveröffentlichungen, nicht zu neu gehosteten Kopien. Höre einen ganzen Song mit Kopfhörern und danach über Lautsprecher bei ähnlicher Lautstärke. Der Refrain allein genügt nicht.

Vergleich mit Suno, MiniMax Music 3 und ACE-Step

Suno: Komfort, Abos und Downloads

Die Suno-Versionshinweise vom 9. September nennen v6, v6 wild und v6 mini. Das v5 im Benchmark ist ein konkreter historischer Vergleich, nicht das gesamte aktuelle Angebot. Suno reduziert den Installationsaufwand; YuE2 setzt auf lokale Ausführung und bearbeitbare Kompositionsstruktur.

Offizielle Suno-Preisseite mit regionaler Anzeige in Yen
Offizielle Suno-Preisseite mit regionaler Anzeige in Yen — Quelle

Der US-Referenzpreis entspricht 8 US$/Monat für Pro und 24 US$/Monat für Premier bei jährlicher Abrechnung. Das sind weder monatlich kündbare Preise noch deutsche Eurotarife. Währung, Steuern und Zeitraum im eigenen Checkout prüfen; auch der Yen-Screenshot ist kein deutsches Angebot.

Laut Downloadregel vom 3. September erhalten Gratisaccounts sieben Testdownloads über ihre gesamte Laufzeit. Pro und Premier haben 20 beziehungsweise 60 pro Monat; für den Studio-Workflow gibt es eine gesonderte Ausnahme. Streaming und Linkfreigabe bleiben möglich. „Gratisnutzer können nie herunterladen“ ist somit zu pauschal. Credits, Downloads und kommerzielle Rechte sind getrennte Grenzen.

MiniMax Music 3: größere Architektur, andere Lizenz

Offizielle Modellkarte von MiniMax Music 3 auf Hugging Face
Offizielle Modellkarte von MiniMax Music 3 auf Hugging Face — Quelle

MiniMax Music 3 kombiniert ein globales 8B-Modell, ein lokales 0,6B-Modell und weitere Synthesekomponenten. Es erzeugt bis zu fünf Minuten Stereo mit 32 kHz. YuE2s Hauptmodell ist kleiner, aber Parameterzahlen allein bestimmen weder VRAM noch Hörqualität.

Ein offizieller Space ist vorhanden. Die Music3 Community License enthält Namens-/Zuordnungsbedingungen, Schutzvorgaben und zusätzliche Genehmigungspflichten bei erfassten Jahresumsätzen über 20 Millionen US-Dollar. Sie ist nicht mit YuE2s Lizenz gleichzusetzen.

ACE-Step: lokale Überarbeitung und Hardware-Flexibilität

Offizielles ACE-Step-1.5-Repository mit Installationsinformationen
Offizielles ACE-Step-1.5-Repository mit Installationsinformationen — Quelle

ACE-Step 1.5 bietet unter MIT Generierung, Cover und Repainting. Die Anleitung unterscheidet etwa 4 GB für DiT allein und mindestens 6 GB für LM plus DiT. Neuere XL-Varianten nutzen einen 4B-DiT und nennen mindestens 12 GB mit Offloading/Quantisierung sowie 20 GB empfohlen. Die kleinsten Anforderungen gelten nicht für XL.

Wähle YuE2 wegen der bearbeitbaren Kompositionsebene, vergleiche ACE-Step für lokale Revisionen und gehostete Dienste für weniger Einrichtung. Für kommerzielle Arbeit muss die Lizenz genauso zählen wie der Klang.

Häufige Fragen

Ist YuE2 vollständig offen und kostenlos kommerziell nutzbar?

Eigener Code und Dokumentation stehen unter Apache 2.0, die Gewichte unter CC BY-NC 4.0. Ältere Archive behalten ihre mitgelieferten Lizenzen. Ein Download erlaubt nicht automatisch bezahlte Dienste oder Kundenprojekte.

Reicht eine 8-GB-Grafikkarte?

Der gemessene Q4-Verbrauch liegt nahe daran, wurde aber auf einer 5090 ermittelt. Das ist ein Ansatz für Experimente mit vorhandener Hardware, keine Kaufgarantie. Offiziell werden weiterhin 24 GB NVIDIA empfohlen.

Singt es gutes Deutsch oder Japanisch?

Japanische Beispiele existieren, einschließlich dokumentierter Aussprachefehler. Daraus folgt keine perfekte deutsche Aussprache. Teste kurze Zeilen und prüfe Vokale, Konsonanten und ausgelassene Wörter vor längeren Songs.

Bleiben bei Partituränderungen Stimme und übriger Song gleich?

Das ist nicht garantiert. Die Partitur steuert die Komposition, die Synthese erzeugt eine neue Aufnahme. Klangfarbe, Timing und Begleitung können variieren; sichere bevorzugte Versionen.

Warum klingt mein erster Versuch schlechter als die Demo?

Auswahl, Genre, Prompt, Decoder und Einstellungen können abweichen. Zähle auch misslungene Versuche in deiner Bewertung. Best-of-8 garantiert kein entsprechendes Ergebnis beim ersten Aufruf.

Gibt es NSFW-Unterstützung oder explizite Liedtexte?

Die Veröffentlichung garantiert keine allgemeine NSFW-Unterstützung. Lokale Ausführung belegt keinen „unzensierten Modus“, und Demos können eigene Regeln haben. Dieses Verhalten ist nicht verifiziert.

Fazit: gezielt ausprobieren statt nach dem Bestwert kaufen

YuE2 macht Melodie und Harmonie vor dem fertigen Audio sichtbar. Für nichtkommerzielle Songideen, Arrangement-Lernen und Forschung ist das ein echter Vorteil. Die Beispiele rechtfertigen einen Versuch, bei dem jeder Song einzeln geprüft wird.

Für kommerzielle Veröffentlichungen, saubere Stimmen beim ersten Versuch oder reine Ein-Klick-Nutzung ist es keine automatische Empfehlung. Höre dein Zielgenre an, teste einen Ausschnitt auf vorhandener Hardware und erweitere zu ComfyUI, sobald der Klang deinen Zweck erfüllt.

Bewertungs-Tags

#ComfyUI #GGUF #KI-Musik #YuE2-3B

Anmelden

ODER

Konto erstellen

Passwort muss 8-20 Zeichen lang sein und Buchstaben und Zahlen enthalten

ODER

Passwort Vergessen

Passwort muss 8-20 Zeichen lang sein und Buchstaben und Zahlen enthalten