YuE2-3B: música local con IA, Suno y ComfyUI
Análisis de YuE2-3B: calidad frente a Suno, instalación local, VRAM, workflow de ComfyUI, muestras musicales y límites de su licencia no comercial.
YuE2-3B destaca cuando quieres modificar la composición, no solo generar otra versión de una canción terminada. Convierte letras y una descripción del estilo en voces y acompañamiento, con una partitura editable de melodía y acordes. Es una propuesta interesante para experimentar, estudiar arreglos y hacer investigación musical sin fines comerciales.
Todavía no es un «Suno gratis» sin condiciones. Los pesos tienen una licencia no comercial, la instalación oficial recomienda una GPU NVIDIA de 24 GB y las opiniones sobre el sonido son dispares. Además, su mejor resultado publicado selecciona entre ocho candidatos. Conviene escuchar ejemplos antes de comprar hardware.
Actualizado el 16 de septiembre de 2026. Análisis basado en el modelo publicado, documentación oficial y pruebas atribuidas a la comunidad; no es un benchmark de audio ejecutado por AirMore.
Qué hace YuE2-3B y qué cambia frente a YuE
El repositorio oficial presenta un modelo de la clase 3B que combina planificación musical y síntesis. En su configuración predeterminada, crea primero una partitura ABC con melodía y acordes, y después audio estéreo a 48 kHz. También necesita un decodificador: «3B» no describe toda la memoria utilizada.

| Control | Uso práctico |
|---|---|
| cot="full" | Planifica melodía y acordes; punto de partida para componer una canción. |
| cot="melody" | Conserva la melodía como referencia y permite variar el acompañamiento. |
| cot="off" | Genera a partir de estilo y letra, sin planificación simbólica. |
| abc=… | Introduce una partitura ABC propia o editada en los modos full o melody. |
ABC es notación textual: no significa que admita directamente cualquier foto, PDF o MIDI. La guía de generación explica los formatos y resultados intermedios. El resultado es una mezcla estéreo; para obtener pistas separadas hace falta otra herramienta. Tampoco se garantiza una interpretación idéntica a la partitura.
La mejora más útil respecto al primer YuE es esa capa de composición visible. Sin embargo, editar la partitura produce una grabación completa nueva: no mantiene necesariamente intacto el audio fuera del cambio. Guarda la toma original si quieres conservar una voz concreta.
Dónde probarlo, escuchar muestras y descargarlo
| Enlace | Qué ofrece |
|---|---|
| Demostración oficial | Canciones, letras, estilos, partituras y comparaciones de edición; no es una suscripción de generación. |
| Modelo oficial en Hugging Face | Pesos y ficha técnica; no equivale a una API de inferencia siempre disponible. |
| Interfaz de levibrg | Demo comunitaria con Create/Cover, letra, estilo, planificación, seed y opciones MP3/FLAC. |
| Space de mrfakename | Demo comunitaria sujeta a disponibilidad y cuota ZeroGPU; no estaba disponible el 16 de septiembre. |
| WebUI de audio.cpp | Interfaz de navegador que funciona con el modelo instalado en tu propio equipo. |

La interfaz de levibrg era accesible el 16 de septiembre, pero eso no garantiza una generación correcta ni GPU disponible. Los Spaces comunitarios no son una API oficial de M·A·P ni un servicio gratuito con disponibilidad garantizada. Un dominio con «YuE2» tampoco demuestra que pertenezca al equipo.
Empieza con una estrofa y un estribillo originales, un idioma explícito y pocos instrumentos bien definidos. Guarda juntos prompt, seed y partitura. Comprueba el tratamiento de los archivos antes de subir grabaciones privadas a una demo pública.
¿Compite con Suno? Lo que significa Best-of-8
El WildSongBench oficial utiliza 192 prompts y evaluación automática, no una escucha ciega independiente. SongBench Avg mide más favorablemente los valores altos; PER es la tasa de error de fonemas y debe ser baja.
| Modelo / configuración | SongBench Avg ↑ | PER ↓ |
|---|---|---|
| YuE2, best-of-8 | 6.9632 | 9.79% |
| Suno v5 | 6.8721 | 8.10% |
| YuE2, estándar / 2 candidatos | 6.7316 | 8.44% |
| Suno v6 | 6.5562 | — |
| MiniMax Music 3 | 6.2830 | 6.27% |
| ACE-Step 1.5 | 6.0118 | 7.46% |
| YuE 1 | 4.9165 | 36.38% |
La fila estándar de YuE2 ya selecciona entre dos candidatos. Best-of-8 selecciona entre ocho. Una llamada normal al pipeline genera un candidato; la selección es otra etapa. Por eso no debe llamarse Best-of-1 al resultado estándar. Ocho intentos también requieren más cómputo y tiempo de escucha.
Ambas cifras de YuE2 usan YuE2-Vae-legacy, mientras que el decodificador habitual para escuchar es YuE2-Vae. El proyecto describe un compromiso entre musicalidad medida y calidad perceptual. Compara siempre decodificador, número de candidatos, prompts y parámetros.
La tabla demuestra competitividad en ese protocolo, no superioridad universal en voces, guitarras o géneros. Una puntuación menor de una versión comercial más nueva tampoco demuestra que haya empeorado en todos los usos.
Experiencias reales: avances y resultados irregulares
La prueba de kun432 en Zenn incluye instalación en Colab L4, registros y muestras. El autor informa de unos cuatro minutos de generación y aproximadamente 9 GB de VRAM máxima en ese entorno. Hay errores de pronunciación en japonés y el autor aclara que no ha usado Suno: no es una comparación directa con Suno.

Las notas de asfdrwe en Qiita documentan Fedora 44, Radeon RX 7800 XT y audio.cpp con Q4, instrucciones HIP y una canción de pop japonés. Son evidencia de una configuración AMD concreta, no compatibilidad oficial con cualquier Radeon. También registran cambios en las opciones de carga.
En el debate inicial de Reddit, GreyScope comenta su ejecución en una 4090; martinerous describe ruido granular o «AI sand», y Sindre_Lovvold critica guitarras de rock/metal y fidelidad al género. Un debate posterior sobre versiones recoge impresiones mucho más positivas. Son testimonios con estilos y selección diferentes, no una estadística de aciertos.
Escucha vocales sostenidas, consonantes, ataques de guitarra, colas de platillos, transiciones y finales. Para música de fondo, busca voces no deseadas; para canciones, revisa toda la letra. Un buen fragmento de metales no garantiza cuatro minutos de arreglo estable. La evidencia concreta procede sobre todo de desarrolladores y usuarios; todavía no hay un consenso sólido de grandes medios basado en escuchas independientes.
Requisitos, VRAM y velocidad
| Ruta | Datos publicados | Interpretación |
|---|---|---|
| PyTorch oficial, BF16 | Linux, Python 3.12, NVIDIA compatible con BF16; 24 GB de VRAM y 24 GB de RAM recomendados. | Configuración de referencia, no consumo constante de 24 GB. |
| Medición oficial con RTX 4090 | Modo full: 214,85 s de audio en 71,04 s; máximo de 11,18 GiB. | Ejecución en caliente; no incluye instalación ni primera descarga. |
| Contexto más largo | Máximo publicado de 14,08 GiB. | Reserva margen para decodificador y otras aplicaciones. |
| GGUF comunitario | Modelo Q8/Q4, VAE y archivos de configuración/tokenizador. | Runtime distinto con sus propias instrucciones. |
La ficha oficial sitúa los pesos principales y el VAE predeterminado en unos 7,8 GB. Como margen práctico, reserva 20–30 GB libres en SSD y considera 32 GB de RAM para un equipo nuevo; son recomendaciones de planificación, no mínimos oficiales.
| Configuración audio.cpp | Audio generado | Tiempo | VRAM máxima |
|---|---|---|---|
| BF16 + F32 VAE | 224.96 s | 60.46 s | 12,535 MiB |
| Q8_0 + F16 VAE | 194.84 s | 38.81 s | 8,867 MiB |
| Q4_0 + F16 VAE | 221.12 s | 44.15 s | 7,755 MiB |
Estas mediciones del mantenedor de audio.cpp corresponden a una RTX 5090, después de una solicitud de calentamiento. Las duraciones de salida cambian: no son grabaciones idénticas. Un pico de 7.755 MiB con Q4 en una 5090 no garantiza que cualquier tarjeta de 8 GB complete el trabajo.

Si ya tienes una GPU adecuada, no pagas créditos por canción. Si necesitas comprarla para un uso ocasional, cuenta equipo, electricidad, mantenimiento e intentos descartados. Descargar el modelo gratis no elimina el coste de generar ocho candidatos.
Instalación local con Python o GGUF
Linux y NVIDIA: instalación oficial
Usa un entorno limpio de Python 3.12 y el inicio rápido oficial. Estas instrucciones proceden de la documentación; no implican pruebas de AirMore en cada GPU.
git clone https://github.com/multimodal-art-projection/YuE.git cd YuE python3.12 -m venv .venv source .venv/bin/activate python -m pip install --upgrade pip python -m pip install . python examples/generate.py --output outputs/first-song La primera ejecución descarga los pesos. Escucha outputs/first-song/audio.flac y conserva la carpeta completa. Guarda el siguiente ejemplo original en inglés como my_song.py y ejecuta python my_song.py. Puedes sustituir letra e idioma; empieza con frases cortas para evaluar la pronunciación.
from yue2 import YuE2Pipeline with YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B", device="cuda") as pipe: song = pipe( style="English, warm piano pop, 96 BPM, clear lead vocal, " "soft drums, restrained verse, wider final chorus", lyrics="[Verse]\nThe station lights are fading slow\n" "I keep a little hope to go\n\n" "[Chorus]\nOne more morning, one more mile\n" "Carry me home with a quiet smile", cot="full", seed=42, ) song.save_artifacts("outputs/my-song") print(song.truncated) Comprueba song.truncated y result.json: un archivo reproducible puede haber alcanzado el límite de tokens. Conserva partitura, parámetros y versiones del modelo/VAE. Consulta las guías de edición y transcripción con SheetSage2 para versiones. La generación normal desde texto no exige descargar MERT2.
audio.cpp, Windows y AMD
audio.cpp v0.8.0, del 15 de septiembre, integra YuE2 y SheetSage2 en main; la antigua exigencia de usar dev ya no describe esta versión. Descarga el paquete GGUF y sus componentes: modelo principal, VAE, configuración y tokenizador. Un único archivo de pesos no basta.
Sigue las opciones actuales de carga de la CLI o WebUI. Los paquetes CUDA de Windows necesitan su runtime correspondiente; en AMD, usa las notas de HIP/ROCm. Distingue archivos ausentes, kernels incompatibles, conflictos de Torch y falta de memoria. Mantén separado el Python oficial del de ComfyUI y prueba primero una canción corta.
Workflow de ComfyUI: partitura, generación y guardado
FL YuE2 para ComfyUI incorpora un piano roll y nodos por etapas. Su mantenedor valida Windows, Python 3.12, Torch 2.11 y RTX PRO 6000 Blackwell; otros dispositivos y configuraciones de 24 GB no están validados para esta integración. La recomendación del pipeline oficial no es una garantía para cualquier nodo.

Descarga score_editor_to_song.json o el JSON sin procesar. Instala los nodos con ComfyUI Manager, o ejecuta lo siguiente usando el intérprete de Python de ComfyUI y reinicia. En la versión portable, usa su intérprete integrado.
cd ComfyUI/custom_nodes git clone https://github.com/filliptm/ComfyUI-FL-YuE2.git cd ComfyUI-FL-YuE2 python -m pip install -r requirements.txt - Arrastra el JSON a ComfyUI y resuelve los nodos que falten.
- Load Models descarga aproximadamente 7,8 GB en ComfyUI/models/yue2/ durante la primera carga.
- Ajusta notas y acordes en Piano Roll Score Editor; el ejemplo contiene ocho compases.
- Sigue las conexiones de la partitura hasta la planificación y generación de audio; conserva los resultados intermedios aceptados.
- El ejemplo usa 32 pasos y un límite de audio de 45 segundos. Empieza con esa prueba corta.
- Escucha con PreviewAudio y guarda con SaveAudio, junto con el workflow y la seed.
Que se complete la ejecución no garantiza calidad musical. Antes de ampliar la duración, comprueba ruido, transiciones y letra; si falla la carga, revisa nodos, archivos y memoria.
Conserva primero la partitura instrumental de ocho compases. Para una canción nueva, desconecta su entrada, escribe estilo y letra en Compose y mantén full. La cadena es Piano Roll → Compose → Render Music → Decode Audio → Preview/Save, con un cargador compartido. Para música instrumental, deja la letra vacía. Los archivos se guardan en output/audio/YuE2/; 45 segundos es un máximo, no una duración exacta. Reducir tile_frames puede ahorrar memoria del decodificador, pero no resuelve todos los errores de memoria. SheetSage2 requiere un entorno previo separado para este pack; no mezcles archivos y ajustes de los nodos nativos con los de FL.
Muestras musicales que merece la pena comparar
| Muestra | Qué escuchar |
|---|---|
| Canciones y ediciones oficiales | Correspondencia entre letra, estilo, partitura y resultado. |
| The Last Train y sus 14 versiones | Cuánto permanece la melodía al cambiar el arreglo. |
| Canción original japonesa de kun432 | Pronunciación, vocales y omisiones de letra. |
| Versión japonesa de kun432 | Cambios de melodía, voz y acompañamiento; consulta también Zenn. |
| Comparaciones BF16/Q8/Q4 | Ruido y detalle instrumental con cuantización. |
Los reproductores externos pueden pedir acceso o verificación. Los enlaces llevan a los originales, sin alojar copias. Escucha una canción entera con auriculares y después con altavoces, a volumen comparable; no decidas solo por el estribillo.
YuE2 frente a Suno, MiniMax Music 3 y ACE-Step
Suno: comodidad, precio y descargas
Las notas de Suno del 9 de septiembre incluyen v6, v6 wild y v6 mini. El v5 de la tabla es una referencia histórica concreta, no toda la oferta actual. Suno simplifica la generación alojada; YuE2 permite trabajar localmente con la estructura de la composición.

La tarifa de referencia estadounidense equivale a US$8 al mes para Pro y US$24 para Premier con facturación anual; no son tarifas de pago mensual ni precios locales en euros. Comprueba moneda, impuestos y periodo en tu cuenta. La captura en yenes tampoco representa una oferta española.
Según la regla de descargas del 3 de septiembre, las cuentas gratuitas tienen siete descargas de prueba durante toda su vida; Pro y Premier ofrecen 20 y 60 al mes, con una excepción para el flujo Studio. Escuchar y compartir enlaces sigue siendo posible. «Gratis significa que nunca puedes descargar» es incorrecto; separa créditos, descargas y derechos comerciales.
MiniMax Music 3: arquitectura mayor y otra licencia

MiniMax Music 3 combina un modelo global de 8B, uno local de 0,6B y otros componentes, con hasta cinco minutos de audio estéreo a 32 kHz. El núcleo de YuE2 es menor, pero los parámetros no predicen por sí solos VRAM ni calidad auditiva.
Hay un Space oficial. La Music3 Community License incluye condiciones de atribución/nombre, salvaguardas y autorización adicional para ingresos anuales cubiertos superiores a US$20 millones. No comparte las condiciones de YuE2.
ACE-Step: iteración y flexibilidad local

ACE-Step 1.5, con licencia MIT, ofrece generación, versiones y repintado. Distingue unos 4 GB para DiT solo y al menos 6 GB para LM más DiT. Los modelos XL recientes emplean un DiT de 4B y señalan al menos 12 GB con descarga a RAM/cuantización, recomendando 20 GB. No apliques los mínimos pequeños a XL.
Elige YuE2 por su composición editable; considera ACE-Step para revisiones locales y servicios alojados si prima ahorrar instalación. Para trabajo comercial, la licencia es tan decisiva como el sonido.
Preguntas frecuentes
¿Es totalmente abierto y gratuito para uso comercial?
El código y la documentación propios usan Apache 2.0, pero los pesos usan CC BY-NC 4.0. Los archivos antiguos conservan sus licencias incluidas. Poder descargarlos no autoriza cualquier servicio de pago o encargo comercial.
¿Funciona con una GPU de 8 GB?
Q4 se acerca a ese consumo, pero la medición se hizo en una 5090. Sirve para experimentar con hardware existente, no como garantía de compra. La ruta oficial sigue recomendando 24 GB NVIDIA.
¿Canta bien en español o japonés?
Hay ejemplos japoneses, con errores documentados. No demuestran precisión en español ni en todos los idiomas. Prueba frases cortas y revisa vocales, consonantes y palabras omitidas antes de generar canciones largas.
¿Editar la partitura mantiene la misma voz y el resto intacto?
No hay esa garantía. La partitura controla la composición, pero la síntesis crea otra grabación; pueden cambiar timbre, tiempos y acompañamiento. Conserva las tomas que te gusten.
¿Por qué la demo suena mejor que mi primer intento?
Cambian selección, género, prompt, decodificador y ajustes. Incluye los intentos fallidos al evaluar el modelo. Best-of-8 no promete esa calidad en una sola llamada.
¿Admite NSFW o letras explícitas?
La publicación no garantiza compatibilidad universal con NSFW. Ejecutarlo localmente no demuestra un «modo sin censura» y cada demo puede tener reglas propias. Es un comportamiento no verificado.
Veredicto: merece una prueba centrada en tu música
YuE2 hace visibles melodía y armonía antes de terminar el audio. Para composición no comercial, aprendizaje de arreglos e investigación, esa capacidad añade valor real a un entorno local. Las muestras justifican probarlo, con selección canción por canción.
No es la opción automática para lanzamientos comerciales, voces perfectas al primer intento o principiantes que solo desean pulsar un botón. Escucha tu género, prueba un fragmento con el equipo que ya tienes y amplía a ComfyUI cuando el sonido resulte útil.