论文

根据自由格式文本提示统一合成组合语音和声音

Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts

应用与实践内容创作

摘要

音频生成已经取得了重大进展,但合成语音和声音自然合成的统一音频仍然是一个挑战。当前的方法要么依赖于不相交的管道,无法捕获细粒度的交互,要么需要结构化输入和外部文本重写,这限制了自由格式文本提示的灵活性。在本文中,我们介绍了一项新任务:自由格式文本提示到统一音频生成,其目的是从不受约束的自然语言中直接合成包含语音、声音及其复合材料的统一音频。为了解决这个任务,我们提出了 PlanAudio,一个基于 LLM 的统一自回归框架。首先,它通过利用固有的 LLM 推理功能而不是传统的文本编码器来简化模型架构。其次,它引入了语义潜在思维链机制,这是一种连接高层语义理解和低层声学合成的隐式规划机制。此外,我们还创建了 PlanAudio-Bench,这是一个用于评估复合音频场景的专门基准。我们在语音、声音及其组合的场景中进行评估。结果表明,PlanAudio 通常优于现有管道和统一基线,同时与针对单一场景设计的模型保持竞争力。我们的分析进一步揭示了语义潜在 CoT 相对于其他 CoT 机制的优越性,并强调了连续多场景训练课程的重要性。