论文

WordVoice:基于 LLM 的 TTS 的显式且解耦的多维字级控制

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

应用与实践内容创作

摘要

虽然最近基于 大语言模型 (LLM) 的文本转语音 (TTS) 系统已经实现了显着的自然度,但它们主要依赖于隐式的端到端生成范例,导致粗粒度控制。在需要精确的文体干预和严格的时间对齐的场景中,例如有声读物旁白和视频配音,无法显式操作单词级声学属性仍然是一个关键瓶颈。这种限制主要是由于细粒度注释数据集的严重缺乏以及将多维控制信号集成到离散自回归生成中的架构挑战而放大的。为了解决这个问题,我们提出了一个用于高精度字级控制的统一框架。首先,我们构建了 WordVoice-5A,这是一个 4700 小时的大型双语数据集,具有通过严格的语言指导管道开发的五维单词级注释(持续时间、边界、能量、音调和语气)。其次,我们引入WordVoice,将隐式生成过程转变为显式的、高度可控的范式。具体来说,我们在 LLM 中引入了绑定词元机制,以制定明确的“声学规划”流程,从而实现自适应多任务韵律规划和灵活的手动干预。此外,我们使用细粒度声学调制模块增强了词元到波形阶段,弥合了分辨率差距,以严格对齐高度压缩的离散词元和连续波形之间的字级属性。大量实验表明,WordVoice 在多个声学维度上实现了卓越的解耦控制,同时保持了具有竞争力的零样本合成稳定性。代码和音频示例可在 https://xxh333.github.io/wordvoice-demo/ 上公开获取。