Génération de voix dans Suno v5.5 : Création de datasets vocaux pour timbre et style
La fonctionnalité « Votre Voix » dans Suno v5.5 permet de créer des voix à partir de datasets vocaux personnalisés. Le système décompose la voix en timbre, intonation et articulation. Le timbre est façonné par la géométrie des voies vocales, l'intonation par les variations de hauteur avec vibrato et glissandos, et l'articulation par les mouvements de la langue et des lèvres. Cette approche offre une grande flexibilité : le modèle de timbre s'associe à l'intonation et l'articulation pour n'importe quelle langue.
La reconnaissance de la voix repose sur l'équilibre de ces éléments. Si le résultat ne sonne pas juste, vérifiez quel composant pose problème.
Catégories de timbre
Le timbre chanté se décrit avec ces catégories :
- Puissant (Fort) : Voix résonante avec un formant de chanteur autour de 2,5 kHz, typique de l'opéra.
- Normal (Neutre) : Équilibré sans tension.
- Soufflé (Aéré) : Aérien avec de l'air, proche des notes chuchotées.
Des outils comme Synth-V ajoutent des descripteurs de style : Doux, Puissant, Clair, Sombre. Vocaloid met l'accent sur Souffle, Dynamique et Ouverture.
Préparation des datasets vocaux
Les tests ont utilisé 11 datasets (DS) allant de 6 secondes à 4 minutes. Voix non accordées et styles de parole variés. Génération dans 9 styles avec Weirdness de 0 à 90 et Influence Style/Audio de 50 à 100.
Premiers 7 DS :
- Puissant (voix, fort).
- Normal (voix).
- Théâtre (parole, dramatique).
- Pleurs (pleurs émotionnels).
- Mixte (combinaison de 1–4).
- Parole expressive (poésie avec expression).
- Parole inexpressive (poésie monotone).
4 DS supplémentaires pour plus de précision :
- Soufflé (aérien, basses nettoyées).
- RVC DS (voix/parole russe/anglais).
- Une chanson (chanson unique avec puissant/normal/soufflé).
- Ensemble de chansons (extraits de 8 chansons).
Les datasets avec intonation distincte (Pleurs, RVC) ou timbre marqué (Puissant, Soufflé) donnent des résultats reconnaissables. Les datasets de parole produisent du rap précis avec émotion et rythme.
Arrangement avec votre propre mélodie
Pour les arrangements, partez d'une esquisse MIDI : mélodie, rythme et harmonie en version sèche (sans effets). Convertissez en MP3 et utilisez le mode Cover + Votre Voix + Paroles + Style.
Conseils pour l'esquisse :
- Notes simples : Noires pour accords/basse permettent des variations (croches, triolets).
- Mélodie : Clarinette GM ou Lead 6 (voix) ; mélodie fredonnée avec accordage ; Synth-V/Vocaloid.
- Harmonie : Restez basique (évitez Am7/G, Csus2) ; le système simplifie souvent en majeur/mineur.
Testé sur 8 DS : chanson folk, « Make Me Feel », « Red Hair Girl ». Une forte Influence Audio booste la similarité.
Utiliser des pistes finies comme esquisses limite la liberté stylistique et la qualité.
Facteurs clés pour préserver le timbre
Ce qui compte :
- Gamme de hauteur dans l'esquisse correspond au DS ; le système l'étend mais déforme si les données sont rares.
- Prompt/Style aligné sur le DS : le R&B ajoute des glissandos qui clashent avec les voix puissantes.
- Forte Influence Audio priorise le DS.
Limitez la variabilité des paroles, en ajustant les couplets pour contrôler la mélodie.
Points clés à retenir
- Décomposer la voix en timbre, intonation et articulation permet une synthèse flexible.
- Plusieurs DS par style : un ensemble universel ne couvre pas toutes les chansons.
- Esquisses sèches simples maximisent les variations d'arrangement.
- Forte Influence Audio et Style cohérent gardent la reconnaissance.
- Datasets de parole produisent du rap pro avec émotion.
— Editorial Team
Aucun commentaire pour le moment.