Generování vokálu v Suno v5.5: tvorba datových sad pro timbre a styl
Funkce „Your Voice“ v Suno v5.5 umožňuje generovat vokál na základě uživatelských datových sad. Systém rozkládá hlas na timbre, intonaci a artikulaci. Timbre je určeno geometrií hlasového aparátu, intonace změnami výšky tónu s vibrato a melismami, artikulace prací jazyka a rtů. To zajišťuje flexibilitu: model timbre lze kombinovat s intonací a artikulací pro jakýkoli jazyk.
Rozpoznatelnost hlasu závisí na vyváženosti těchto složek. Pokud generace nepřipomíná originál, analyzujte, který prvek je zkreslený.
Klasifikace timbre
Pro popis timbre v pění se používají kategorie:
- Power (Silný): znějící hlas s pěveckou formantou ~2,5 kHz, typický pro operu.
- Normal (Neutrální): neutrální bez napětí.
- Breathy (Dýchavý): s přídechem, blízko šepotu s tóny.
Systémy jako Synth-V přidávají styl: Soft, Power, Bright, Dark. Vocaloid se zaměřuje na Breathiness, Dynamics, Opening.
Příprava hlasových datových sad
Testování probíhalo na 11 datových sadech (DS) o délce 6 s – 4 min. Vokální bez tuningu, řečové v různých stylech. Generace v 9 stylech s parametry Weirdness 0–90, Style/Audio Influence 50–100.
Prvních 7 DS:
- Power (vokál, silný).
- Normal (vokál).
- Divadlo (řeč, divadelní).
- Pláč (pláč).
- Smíšený (sbírka 1–4).
- Výrazná řeč (básně s výrazem).
- Nevýrazná řeč (monotónní báseň).
Další 4 DS pro přesnost:
- Breathy (dýchavý, nízké frekvence očištěné).
- RVC DS (vokál/řeč Ru/En).
- Jedna píseň (jedna píseň s power/normal/breathy).
- Sada písní (úryvky z 8 písní).
DS s výraznou intonací (Pláč, RVC) nebo timbrem (Power, Breathy) dávají rozpoznatelný výsledek. Řečové DS zajišťují přesný recitativ s emocemi a rytmem.
Aranžmá s vlastní melodií
Pro aranžmá vytvořte MIDI nástin: melodie, rytmus, harmonie v suché formě (bez efektů). Převeďte do MP3, použijte režim Cover + Your Voice + Lyrics + Style.
Doporučení pro nástin:
- Jednoduché noty: čtvrťové pro akordy/bas umožňují variace (osminové, trioly).
- Melodie: GM Clarinet nebo Lead 6 (hlas); nápev s tuningem; Synth-V/Vocaloid.
- Harmonie: vyhněte se složitostem (Am7/G, Csus2); systém může zaokrouhlit na dur/moll.
Testováno na 8 DS: lidová píseň, „Make Me Feel“, „Red Hair Girl“. Vysoký Audio Influence zvyšuje podobnost.
Hotové skladby jako nástin snižují svobodu stylu a kvalitu.
Klíčové faktory zachování timbre
Co je důležité:
- Výškový rozsah nástinu odpovídá DS; systém rozšiřuje, ale morfuje při nedostatku dat.
- Prompt/Style odpovídá DS: R&B přidá melismy, nevhodné pro power hlasy.
- Vysoký Audio Influence pro dominanci DS.
Omezte variabilitu v Lyrics, měňte sloky pro kontrolu melodie.
Co je důležité
- Rozdělení na timbre, intonaci, artikulaci umožňuje flexibilní syntézu.
- Několik DS pro styly: univerzální nepokryje všechny písně.
- Jednoduchý suchý nástin maximalizuje variace aranžmá.
- Vysoký Audio Influence a odpovídající Style zachovávají rozpoznatelnost.
- Řečové DS dávají profesionální recitativ s emocemi.
— Editorial Team
Zatím žádné komentáře.