论文

综合各种自然主义全双工对话的工具

A Harness for Synthesizing Diverse Naturalistic Full-Duplex Conversations

模型训练合成数据

摘要

边听边说的全双工对话系统必须区分完整的回合和回合内的暂停,以及请求回合的中断和对第三方的简短确认或讲话。然而,现有的会话语料库对这些事件的控制有限,对其意图的标签也有限。我们提出了一种从关系事件列表中合成意图标记的双通道对话语音的管道。大语言模型创作每个事件的演讲者、文本、对话行为以及对早期事件的附件,而无需预测绝对时间戳。事件是独立合成的,与其源文本对齐,并放置在共享时钟上,因此轮流地标是从渲染的信号中测量的,同时静音持续时间是从轮流分布中指定或采样的。该管道涵盖了英语和普通话的 8 个家庭的 42 种现象,从创作意图中派生出框架级系统操作,并使用少量、多样化的先前示例集和批量提示(要求具有自我报告概率的替代方案)来促进多样性。消融显示了每个目标多样性维度的收益。在用于获取、保持、释放和不保持会话发言权的四个动作标签空间上,仅使用当前和过去音频的语义语音活动检测器达到开始说和开始听的 F1 分数为 0.819 和 0.802。在生成自己的响应时,全双工语音模型 Moshi 在对生成的语料库进行微调后,需要 0.85 的参考轮数,而微调前为 0.44。预测系统楼层占用率的帧级精度从 0.46 提高到 0.88。通过每一步的参考上下文,其框架级下限 F1 从 0.893 上升到 0.962。这些结果表明,受控合成可以为全双工转弯管理提供可学习和可转移的监督。