YuE2-3B : musique IA en local, Suno et ComfyUI
Avis sur YuE2-3B : qualité face à Suno, installation locale, VRAM, workflow ComfyUI, exemples musicaux et limites de la licence non commerciale.
L’intérêt de YuE2-3B est de pouvoir modifier la composition, plutôt que de relancer simplement la génération d’un morceau. À partir de paroles et d’un style, il produit voix et accompagnement tout en exposant une partition de mélodie et d’accords modifiable. C’est une piste intéressante pour la composition amateur, l’étude des arrangements et la recherche non commerciale.
Ce n’est pas pour autant un « Suno gratuit » sans contraintes. Les poids ont une licence non commerciale, l’installation officielle recommande une carte NVIDIA de 24 Go et les retours sur le son restent partagés. Le meilleur score publié suppose aussi de sélectionner parmi huit propositions. Écoutez les exemples avant d’acheter du matériel.
Mise à jour : 16 septembre 2026. Cette analyse s’appuie sur le modèle publié, la documentation et des essais communautaires attribués à leurs auteurs ; il ne s’agit pas d’un benchmark audio réalisé par AirMore.
Ce que fait YuE2-3B et ce qui change depuis YuE
Le dépôt officiel décrit un modèle de la catégorie 3B associant planification musicale et synthèse audio. Par défaut, il génère une partition ABC avec mélodie et accords, puis un enregistrement stéréo à 48 kHz. Un décodeur distinct fait partie du système : le nom 3B ne résume pas toute la mémoire nécessaire.

| Paramètre | Utilité |
|---|---|
| cot="full" | Planifie mélodie et accords ; point de départ pour une nouvelle chanson. |
| cot="melody" | S’appuie sur la mélodie en laissant varier l’accompagnement. |
| cot="off" | Génère directement depuis le style et les paroles, sans plan symbolique. |
| abc=… | Accepte une partition ABC fournie ou modifiée en mode full ou melody. |
ABC est une notation textuelle, pas une promesse de lire n’importe quelle photo de partition, PDF ou fichier MIDI. Le guide de génération précise les formats et sorties intermédiaires. Le résultat est un mixage stéréo ; obtenir des pistes séparées demande une étape supplémentaire. L’interprétation peut aussi s’écarter du plan.
La couche de composition explicite est l’amélioration pratique par rapport au premier YuE. Cependant, modifier le plan ABC produit un nouvel enregistrement complet : l’audio extérieur à la modification n’est pas nécessairement conservé à l’identique. Gardez la prise d’origine si son interprétation vous plaît.
Où l’essayer, écouter et télécharger le modèle
| Adresse | Ce qu’on y trouve |
|---|---|
| Démonstration officielle | Morceaux, paroles, styles, partitions et exemples d’édition ; pas un abonnement de génération. |
| Modèle officiel sur Hugging Face | Poids et fiche technique ; pas une API d’inférence toujours disponible. |
| Interface de levibrg | Démo communautaire Create/Cover, paroles, style, planification, seed et sorties MP3/FLAC. |
| Space de mrfakename | Hébergement communautaire soumis à la disponibilité et au quota ZeroGPU ; indisponible le 16 septembre. |
| WebUI d’audio.cpp | Interface de navigateur après installation sur votre propre ordinateur. |

L’interface de levibrg était accessible le 16 septembre ; cela ne garantit ni une génération réussie ni un quota GPU suffisant. Ces Spaces ne sont pas une API officielle de M·A·P ou un service gratuit garanti. Un nom de domaine contenant YuE2 ne prouve pas non plus son caractère officiel.
Commencez avec un couplet et un refrain originaux, une langue explicite et quelques indications précises d’instruments et d’ambiance. Enregistrez ensemble prompt, seed et partition. Vérifiez le traitement des fichiers avant d’envoyer des prises privées sur une démo publique.
Est-il au niveau de Suno ? Comprendre le Best-of-8
Le WildSongBench officiel utilise 192 prompts et une évaluation automatique, pas un test d’écoute indépendant en aveugle. SongBench Avg favorise les valeurs élevées ; PER mesure les erreurs de phonèmes et doit être faible.
| Modèle / réglage | SongBench Avg ↑ | PER ↓ |
|---|---|---|
| YuE2, best-of-8 | 6.9632 | 9.79% |
| Suno v5 | 6.8721 | 8.10% |
| YuE2, standard / 2 candidats | 6.7316 | 8.44% |
| Suno v6 | 6.5562 | — |
| MiniMax Music 3 | 6.2830 | 6.27% |
| ACE-Step 1.5 | 6.0118 | 7.46% |
| YuE 1 | 4.9165 | 36.38% |
La ligne standard de YuE2 sélectionne déjà parmi deux candidats. Best-of-8 en sélectionne un parmi huit. Un appel normal du pipeline produit un candidat, puis la sélection constitue une autre étape. Il serait donc incorrect d’appeler le résultat standard Best-of-1. Huit essais coûtent davantage de calcul et d’écoute.
Les deux mesures de YuE2 emploient YuE2-Vae-legacy, alors que le décodeur habituel pour l’écoute est YuE2-Vae. Le projet décrit un compromis entre musicalité mesurée et qualité perçue. Comparez décodeur, prompts, nombre de candidats et réglages avant de conclure.
Ces chiffres montrent une compétitivité dans ce protocole, pas une supériorité générale sur les voix, guitares ou arrangements. Un score inférieur pour une version commerciale plus récente ne signifie pas non plus qu’elle régresse dans tous les usages.
Retours d’utilisateurs : du potentiel, avec des défauts audibles
L’essai de kun432 sur Zenn contient installation Colab L4, journaux et liens d’écoute. L’auteur rapporte environ quatre minutes de génération et un pic proche de 9 Go de VRAM dans cette configuration. Le japonais présente des erreurs de lecture ou de prononciation. L’auteur précise n’avoir jamais testé Suno : ce n’est pas un face-à-face avec Suno.

Les notes d’asfdrwe sur Qiita décrivent Fedora 44, Radeon RX 7800 XT et audio.cpp en Q4, avec compilation HIP et exemple de pop japonaise. C’est une configuration AMD documentée, pas une garantie officielle pour toutes les Radeon. Le billet relève aussi des changements d’options de chargement.
Dans la discussion initiale sur Reddit, GreyScope rapporte une exécution sur 4090 ; martinerous entend un bruit granuleux, surnommé « AI sand », et Sindre_Lovvold critique les guitares rock/metal et le respect du genre. Une discussion ultérieure sur les reprises est bien plus enthousiaste. Il s’agit de témoignages individuels, avec réglages et sélection différents, pas d’un taux de réussite représentatif.
Écoutez les voyelles tenues, consonnes, attaques de guitare, résonances des cymbales, transitions et fins. Pour un fond sonore, repérez les voix indésirables ; pour une chanson, vérifiez chaque parole. Quelques cuivres crédibles ne garantissent pas quatre minutes d’arrangement stable. Les éléments concrets viennent surtout de développeurs et d’utilisateurs ; un consensus de grands médias fondé sur des écoutes indépendantes n’est pas encore établi.
Configuration, VRAM et vitesse
| Solution | Données publiées | Interprétation |
|---|---|---|
| PyTorch officiel, BF16 | Linux, Python 3.12, NVIDIA compatible BF16 ; 24 Go de VRAM et 24 Go de RAM recommandés. | Configuration de référence, pas consommation constante de 24 Go. |
| Mesure officielle RTX 4090 | full : 214,85 s d’audio en 71,04 s ; pic de 11,18 Gio. | Après préchauffage, hors première installation et téléchargement. |
| Contexte plus long | Pic officiel de 14,08 Gio. | Prévoir une marge pour le décodeur et les autres applications. |
| GGUF communautaire | Q8/Q4, VAE, configuration et tokenizer séparés. | Autre moteur d’exécution, avec ses propres instructions. |
La fiche officielle indique environ 7,8 Go de poids pour le modèle et son VAE par défaut. Pour planifier une installation, réservez 20–30 Go libres sur SSD et envisagez 32 Go de RAM pour un nouveau PC ; ce sont des marges pratiques, pas des minima officiels.
| Configuration audio.cpp | Audio généré | Durée du calcul | Pic de VRAM |
|---|---|---|---|
| BF16 + F32 VAE | 224.96 s | 60.46 s | 12,535 MiB |
| Q8_0 + F16 VAE | 194.84 s | 38.81 s | 8,867 MiB |
| Q4_0 + F16 VAE | 221.12 s | 44.15 s | 7,755 MiB |
Ces mesures du mainteneur d’audio.cpp proviennent d’une RTX 5090, après préchauffage. Les durées des fichiers diffèrent : les enregistrements ne sont pas identiques. Un pic Q4 de 7 755 Mio sur cette carte ne garantit pas le même travail sur n’importe quel GPU de 8 Go.

Avec une carte déjà adaptée, la génération locale ne consomme pas de crédits par morceau. Pour un usage occasionnel, acheter une machine impose de compter matériel, électricité, maintenance et essais rejetés. Des poids téléchargeables gratuitement ne rendent pas huit générations sans coût de calcul.
Installation locale : Python officiel et GGUF
Linux et NVIDIA : démarrage officiel
Suivez le démarrage rapide officiel dans un environnement Python 3.12 propre. Ces commandes sont issues de la documentation ; elles ne signifient pas qu’AirMore a testé chaque GPU.
git clone https://github.com/multimodal-art-projection/YuE.git cd YuE python3.12 -m venv .venv source .venv/bin/activate python -m pip install --upgrade pip python -m pip install . python examples/generate.py --output outputs/first-song La première exécution télécharge les poids. Écoutez outputs/first-song/audio.flac et conservez tout le dossier. Enregistrez l’exemple original en anglais ci-dessous dans my_song.py, puis lancez python my_song.py. Remplacez paroles et langue à votre convenance, d’abord avec des phrases courtes.
from yue2 import YuE2Pipeline with YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B", device="cuda") as pipe: song = pipe( style="English, warm piano pop, 96 BPM, clear lead vocal, " "soft drums, restrained verse, wider final chorus", lyrics="[Verse]\nThe station lights are fading slow\n" "I keep a little hope to go\n\n" "[Chorus]\nOne more morning, one more mile\n" "Carry me home with a quiet smile", cot="full", seed=42, ) song.save_artifacts("outputs/my-song") print(song.truncated) Vérifiez song.truncated et result.json : un audio lisible peut malgré tout avoir atteint la limite de tokens. Gardez partition, réglages et versions du modèle/VAE. Consultez les guides d’édition et de transcription SheetSage2 suivie d’une reprise. La génération ordinaire depuis du texte ne nécessite pas MERT2.
audio.cpp, Windows et AMD
audio.cpp v0.8.0, publié le 15 septembre, intègre YuE2 et SheetSage2 à main ; les anciens tutoriels imposant dev sont dépassés sur ce point. Téléchargez dans le paquet GGUF le modèle, le VAE et les fichiers de configuration/tokenizer. Le seul fichier principal ne suffit pas.
Suivez les options actuelles de chargement de la CLI ou WebUI. Les paquets Windows CUDA nécessitent le runtime correspondant ; pour AMD, utilisez les notes HIP/ROCm. Distinguez fichiers manquants, kernels incompatibles, conflits Torch et manque de mémoire. Séparez l’environnement Python officiel de celui de ComfyUI et commencez par un morceau court.
Workflow ComfyUI : de la partition à l’audio
FL YuE2 pour ComfyUI propose un piano roll et des étapes séparées. Le mainteneur valide Windows, Python 3.12, Torch 2.11 et RTX PRO 6000 Blackwell ; les autres appareils et configurations de 24 Go ne sont pas validés pour cette intégration. La recommandation du pipeline officiel ne garantit pas tous les nœuds.

Téléchargez score_editor_to_song.json ou le JSON brut. Installez le pack avec ComfyUI Manager, ou exécutez les commandes suivantes avec l’interpréteur Python de ComfyUI, puis redémarrez. Pour la version portable, utilisez son Python intégré.
cd ComfyUI/custom_nodes git clone https://github.com/filliptm/ComfyUI-FL-YuE2.git cd ComfyUI-FL-YuE2 python -m pip install -r requirements.txt - Glissez le JSON dans ComfyUI et résolvez les nœuds manquants.
- Load Models télécharge environ 7,8 Go dans ComfyUI/models/yue2/ au premier chargement.
- Modifiez notes et accords dans Piano Roll Score Editor ; l’exemple contient huit mesures.
- Suivez les connexions de la partition vers la planification et l’audio ; conservez les résultats intermédiaires acceptés.
- L’exemple utilise 32 étapes et un plafond de 45 secondes d’audio. Commencez par cet essai court.
- Écoutez avec PreviewAudio, puis enregistrez avec SaveAudio, en gardant workflow et seed.
Une exécution réussie ne garantit pas la qualité musicale. Vérifiez paroles, bruit et transitions avant d’allonger le morceau ; en cas d’échec de chargement, examinez d’abord nœuds, fichiers et mémoire.
Conservez d’abord la partition instrumentale de huit mesures. Pour créer une nouvelle chanson, déconnectez cette entrée, saisissez style et paroles dans Compose et gardez full. La chaîne est Piano Roll → Compose → Render Music → Decode Audio → Preview/Save, avec un chargeur partagé. Pour un instrumental, laissez les paroles vides. Les fichiers vont dans output/audio/YuE2/ ; 45 secondes est un plafond, pas une durée exacte. Réduire tile_frames peut alléger le décodeur, sans résoudre tous les manques de mémoire. SheetSage2 nécessite ici un environnement amont distinct ; ne mélangez pas fichiers et paramètres des nœuds natifs avec ceux de FL.
Exemples musicaux à écouter
| Exemple | Point à comparer |
|---|---|
| Morceaux et éditions officiels | Cohérence entre paroles, style, partition et résultat. |
| The Last Train et ses 14 versions | Maintien de la mélodie lorsque l’arrangement change. |
| Création japonaise de kun432 | Prononciation, voyelles et omissions. |
| Reprise japonaise de kun432 | Voix et accompagnement ; compléter par les réglages sur Zenn. |
| Comparaisons BF16/Q8/Q4 | Bruit et détails instrumentaux après quantification. |
Les lecteurs externes peuvent demander une connexion ou une vérification. Ces liens pointent vers les publications originales, sans réhébergement. Écoutez un morceau entier au casque puis sur enceintes, à niveau comparable ; ne jugez pas uniquement le refrain.
Comparaison avec Suno, MiniMax Music 3 et ACE-Step
Suno : simplicité, abonnement et téléchargements
Les notes de Suno du 9 septembre présentent v6, v6 wild et v6 mini. Le v5 du benchmark est donc une référence précise, pas toute l’offre actuelle. Suno simplifie l’accès sans installation ; YuE2 privilégie l’exécution locale et la structure musicale éditable.

Le tarif américain de référence équivaut à 8 US$/mois pour Pro et 24 US$/mois pour Premier avec facturation annuelle. Il ne s’agit ni du paiement mensuel ni d’un tarif français en euros. Devise, taxes et période doivent être vérifiées au paiement ; la capture en yens ne constitue pas une offre française.
La règle du 3 septembre prévoit sept téléchargements d’essai sur toute la durée de vie d’un compte gratuit, puis 20 et 60 par mois pour Pro et Premier, avec une exception liée au workflow Studio. Écoute en ligne et partage de liens restent possibles. Dire que les comptes gratuits ne peuvent jamais télécharger est donc inexact. Crédits, téléchargements et droits commerciaux sont des limites distinctes.
MiniMax Music 3 : architecture et licence différentes

MiniMax Music 3 associe un modèle global de 8B, un modèle local de 0,6B et d’autres composants, avec jusqu’à cinq minutes de stéréo à 32 kHz. Le cœur de YuE2 est plus petit, mais les paramètres ne suffisent pas à prévoir VRAM ou qualité d’écoute.
Un Space officiel est proposé. La Music3 Community License contient des obligations de nom/attribution, des mesures de protection et une autorisation supplémentaire pour les revenus annuels concernés dépassant 20 millions de dollars. Ce n’est pas la licence de YuE2.
ACE-Step : itérations locales et souplesse matérielle

ACE-Step 1.5, sous MIT, propose génération, reprises et retouches par repeinture. La documentation distingue environ 4 Go pour le DiT seul et au moins 6 Go pour LM plus DiT. Les variantes XL récentes utilisent un DiT de 4B, avec au moins 12 Go via déchargement/quantification et 20 Go recommandés. Les minima de la petite configuration ne valent pas pour XL.
Choisissez YuE2 pour sa composition éditable, comparez ACE-Step pour les révisions locales et un service hébergé pour réduire l’installation. Un projet commercial doit être guidé par la licence autant que par le son.
Questions fréquentes
Est-il entièrement ouvert et gratuit commercialement ?
Le code et la documentation de première partie sont sous Apache 2.0, mais les poids sont sous CC BY-NC 4.0. Les anciennes archives conservent leur licence incluse. Le téléchargement n’autorise pas automatiquement un service payant ou une commande client.
Une carte de 8 Go suffit-elle ?
La mesure Q4 s’en approche, mais elle a été réalisée sur une 5090. C’est une piste d’essai avec du matériel existant, pas une garantie d’achat. La configuration officielle reste une NVIDIA de 24 Go.
Peut-il chanter correctement en français ou en japonais ?
Des exemples japonais existent avec des erreurs documentées. Cela ne prouve pas une diction française parfaite. Testez des lignes courtes et vérifiez voyelles, consonnes et mots omis avant un morceau long.
L’édition conserve-t-elle la même voix et le reste du morceau ?
Ce n’est pas garanti. La partition contrôle la composition, mais la synthèse crée une nouvelle prise ; timbre, timing et accompagnement peuvent changer. Gardez vos versions préférées.
Pourquoi mon premier résultat est-il moins bon que la démo ?
Sélection, genre, prompt, décodeur et paramètres peuvent différer. Comptez aussi les essais ratés dans votre évaluation. Best-of-8 n’est pas une promesse de qualité dès le premier appel.
Existe-t-il un support NSFW ou des paroles explicites ?
La publication ne garantit pas un support NSFW universel. Une exécution locale ne démontre pas un « mode sans censure » et chaque démo peut imposer ses règles. Ce comportement reste non vérifié.
Verdict : tester le contrôle musical avant d’investir
YuE2 rend mélodie et harmonie inspectables avant la finalisation audio. Pour la composition non commerciale, l’étude des arrangements et la recherche, cette possibilité a une vraie valeur. Les exemples justifient un essai, avec une sélection morceau par morceau.
Pour une sortie commerciale, une voix parfaite au premier essai ou un fonctionnement en un clic, ce n’est pas le choix automatique. Écoutez votre genre, testez un extrait sur votre matériel et passez à ComfyUI lorsque le son répond à vos besoins.