论文

Agentic-DuplexGen:解耦合成对话语音的内容、时序和声学

Agentic-DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

模型训练合成数据

摘要

合成会话语音已成为开发和评估会话语音系统的重要资源。然而,现有的对话合成管道通常首先生成对话内容,然后使用手工标记或计时规则插入中断、重叠和反向通道,从而使对话计时成为规定的而不是交互驱动的。我们提出了 Agentic-DuplexGen,这是一个对话合成框架,可以明确地解耦内容、时间和声学。 LLM 首先生成对话脚本,然后两个全双工对话模型在实时收听对方的同时执行脚本。这使得对话时间自然出现,同时保留脚本内容。最后,高保真文本转语音模型重新呈现交互而不改变其时间。作为所提出框架的演示,我们构建了一个带有构建时注释的患者-临床医生会话语音语料库,包括单词时间戳、说话者活动、重叠区域和交互事件。实验结果表明,与传统的基于拼接的合成相比,所提出的框架产生的对话动态更接近真实对话。