SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
来自 ByteDance
摘要
语音与音频生成在动画配音、有声剧、电影、广告、游戏、播客和短视频制作中常常不可或缺。在这些场景中,创作者可能需要在没有参考录音的情况下设计声音,用自然语言控制说话人风格,支持带有环境和音效的声学场景,并在后续复用所设计的声音。因此,支持多说话人语音与音频生成,同时涵盖指令任务和零样本任务,显得尤为重要。指令任务要求提供环境、说话人风格和细粒度内容的描述,而零样本任务则使用参考音频以及相同的细粒度内容。我们从数据和模型两方面着手解决这些任务。首先,我们提出SwanData-Caption,它清洗原始语音和音频数据,添加针对性的合成覆盖,并标注多样且准确的多层级描述。接着,我们提出SwanTale,一个支持零样本和指令任务的多说话人表现力语音与音频生成模型。我们引入SwanVAE以支持高质量的多音频模态生成。然后,我们采用奖励条件质量控制、Engram条件化,以及统一MoE进行多任务和多音频模态建模。此外,我们使用课程学习和GRPO后训练,让模型逐步学习并强化其能力。实验结果表明,SwanTale在多个关键零样本和指令指标上领先,在两类任务中均取得最佳表现力得分,并支持涉及多说话人语音和音频的复杂指令生成。演示可在 https://swanaigc.github.io/\#swantale 查看。
译自 Hugging Face · Daily Papers · arXiv:2608.02023 · 录于 二〇二六年八月四日