Generación de Voces en Suno v5.5: Creación de Datasets de Voz para Timbre y Estilo
La función "Tu Voz" en Suno v5.5 te permite crear voces usando datasets personalizados de voz. El sistema descompone la voz en timbre, entonación y articulación. El timbre se define por la geometría del tracto vocal, la entonación por variaciones de altura con vibrato y glissandos, y la articulación por movimientos de lengua y labios. Esta estructura ofrece gran flexibilidad: el modelo de timbre se combina con entonación y articulación para cualquier idioma.
La reconocibilidad de la voz depende de equilibrar estos elementos. Si el resultado no suena bien, revisa qué componente falla.
Categorías de Timbre
El timbre de canto se describe con estas categorías:
- Potente (Fuerte): Voz resonante con formante de cantante alrededor de 2,5 kHz, típico en ópera.
- Normal (Neutral): Equilibrado sin tensión.
- Susurrante (Aireado): Aéreo con aspereza, cerca de notas susurradas.
Herramientas como Synth-V añaden descriptores de estilo: Suave, Potente, Brillante, Oscuro. Vocaloid resalta Aspereza, Dinámica y Apertura.
Preparación de Datasets de Voz
Las pruebas usaron 11 datasets (DS) de 6 segundos a 4 minutos. Voces sin afinar y estilos de habla variados. Generaciones en 9 estilos con Rareza 0–90 e Influencia de Estilo/Audio 50–100.
Primeros 7 DS:
- Potente (voces, fuerte).
- Normal (voces).
- Teatral (habla, dramática).
- Llorando (llanto emocional).
- Mixto (combinación de 1–4).
- Habla Expresiva (poesía con expresión).
- Habla Inexpresiva (poesía monótona).
4 DS adicionales para precisión:
- Susurrante (aireado, graves limpios).
- RVC DS (voces/habla en ruso/inglés).
- Una Canción (canción única con potente/normal/susurrante).
- Conjunto de Canciones (clips de 8 canciones).
Datasets con entonación distinta (Llorando, RVC) o timbre único (Potente, Susurrante) dan resultados reconocibles. Los datasets de habla generan rap preciso con emoción y ritmo.
Arreglos con Tu Propia Melodía
Para arreglos, empieza con un boceto MIDI: melodía, ritmo y armonía en forma seca (sin efectos). Conviértelo a MP3 y usa modo Cover + Tu Voz + Letras + Estilo.
Consejos para el Boceto:
- Notas simples: Corcheas para acordes/bajo permiten variaciones (corcheas, tresillos).
- Melodía: Clarinete GM o Lead 6 (voz); melodía tarareada con afinación; Synth-V/Vocaloid.
- Armonía: Quédate en lo básico (evita Am7/G, Csus2); el sistema puede simplificar a mayor/menor.
Probado con 8 DS: canción folclórica, "Make Me Feel", "Red Hair Girl". Alta Influencia de Audio aumenta la similitud.
Usar pistas terminadas como bocetos limita la libertad de estilo y calidad.
Factores Clave para Conservar el Timbre
Lo que Importa:
- Rango de altura en boceto coincide con DS; el sistema lo extiende pero deforma si faltan datos.
- Prompt/Estilo alineado con DS: R&B añade glissandos que chocan con voces potentes.
- Alta Influencia de Audio prioriza el DS.
Limita la variabilidad de letras, ajustando versos para controlar la melodía.
Conclusiones Principales
- Descomponer la voz en timbre, entonación y articulación permite síntesis flexible.
- Múltiples DS por estilo: un conjunto universal no cubre todas las canciones.
- Bocetos secos simples maximizan variaciones de arreglo.
- Alta Influencia de Audio y Estilo coincidente mantienen la reconocibilidad.
- DS de habla producen rap profesional con emoción.
— Editorial Team
Aún no hay comentarios.