返回首页

Suno v5.5:您自己声音的数据集

本文分解了 Suno v5.5 中 Your Voice 选项的机制:声音分离为音色、语调和发音。描述了 11 个数据集的测试、准备 MIDI 草稿用于编曲,以及保持相似性的因素。为中高级开发者的推荐。

Suno 5.5 中的您自己的声音:测试和机制
Advertisement 728x90

Suno v5.5 生成人声:构建音色与风格语音数据集

Suno v5.5 的“你的声音”功能允许你使用自定义语音数据集创建人声。该系统将声音分解为音色语调发音三个部分。音色由声道的几何形状决定,语调由音高变化(包括颤音和滑音)决定,发音则由舌头和嘴唇运动决定。这种设计提供了极大的灵活性:音色模型可以与任何语言的语调和发音模型搭配使用。

声音的可辨识度取决于这些元素的平衡。如果输出听起来不对劲,就检查哪个部分出了问题。

音色分类

演唱音色使用以下分类描述:

Google AdInline article slot
  • 力量型(强壮):共鸣声,带有歌手特有的2.5 kHz峰值,常见于歌剧。
  • 正常型(中性):平衡、无紧张感。
  • 气声型(呼吸):带气音、空灵,接近耳语。

像 Synth-V 这样的工具还添加了风格描述:柔和、力量、明亮、暗沉。Vocaloid 则强调气声、动态和开口度。

准备语音数据集

测试使用了11个数据集(DS),时长从6秒到4分钟不等。包含未经调音的人声和多种说话风格。在9种风格下生成,怪异度0–90,风格/音频影响50–100。

前7个数据集:

Google AdInline article slot
  • 力量型(人声,强壮)。
  • 正常型(人声)。
  • 戏剧型(戏剧性演讲)。
  • 哭泣型(情感哭泣)。
  • 混合型(1–4的组合)。
  • 富有表现力的演讲(富有表情的诗歌)。
  • 无表情演讲(单调诗歌)。

额外4个用于精细调整的数据集:

  • 气声型(空灵,低频清理)。
  • RVC 数据集(俄英人声/演讲)。
  • 单曲数据集(一首歌,包含力量/正常/气声)。
  • 歌曲集(8首歌的片段)。

具有鲜明语调(哭泣、RVC)或音色(力量、气声)的数据集能产生易辨识的结果。演讲数据集能生成专业级说唱,带有情感和节奏感。

使用自作曲旋律进行编曲

编曲时,从 MIDI 草图开始:旋律、节奏和和声均为干声(无效果)。转换为 MP3,使用翻唱模式 + 你的声音 + 歌词 + 风格。

Google AdInline article slot

草图技巧:

  • 简单音符:和弦/贝斯用四分音符,便于变化(八分、三连音)。
  • 旋律:GM 单簧管或 Lead 6(人声);哼唱旋律并调音;Synth-V/Vocaloid。
  • 和声:坚持基础(避免 Am7/G、Csus2);系统可能会简化为大调/小调。

在8个数据集上测试:民谣、“Make Me Feel”、“红毛女孩”。高音频影响能提升相似度。

使用成品轨道作为草图会限制风格自由度和质量。

保留音色的关键因素

关键点:

  • 草图音高范围匹配数据集;系统会扩展,但数据稀疏时会变形。
  • 提示/风格与数据集匹配:R&B 会添加滑音,与力量型声音冲突。
  • 高音频影响优先数据集特征。

限制歌词变化,通过调整 verse 控制旋律。

核心要点

  • 将声音分解为音色、语调和发音,实现灵活合成。
  • 每种风格需多个数据集:通用集无法覆盖所有歌曲。
  • 简单干声草图最大化编曲变化。
  • 高音频影响 + 匹配风格保持辨识度。
  • 演讲数据集生成专业说唱,饱含情感。

— Editorial Team

Advertisement 728x90

继续阅读