论文
通过通用风格感知全双工框架实现主动口语转向
Enabling Proactive Spoken Turns via a Generalized Style-Aware Full-Duplex Framework
摘要
与系统等待用户回合完成才做出响应的半双工对话系统相比,自然全双工对话系统要求代理实时主动采取行动,包括及时中断和反向通道。这就带来了一个关键挑战:在不牺牲响应质量的情况下改善转弯时间。为了解决现实主动轮流的局限性,我们构建了一个具有三个关键组件的通用风格感知全双工框架。首先,我们提出 LPS-TC,一种用于即插即用集成的轻量级主动语音转向控制器。它具有涵盖被动和主动转向行为的细粒度动作空间,使半双工模型具有全双工功能,并通过卓越的时序控制增强现有的全双工模型。其次,我们构建了 WildTurn,这是一个大规模的真实英语数据集,包含大约 2,981 小时的经过过滤的多轮立体声对话(来自面对面和电话对话),并用五种轮流和五种反向渠道风格进行注释。在 WildTurn 上进行训练后,LPS-TC 展现出现有静态全双工基准无法捕获的丰富语音动态。第三,我们引入了一种两层评估方案,该方案在现实流约束下评估块级计时精度和回合级交互质量。我们的实验将 LPS-TC 与 Qwen2.5-Omni 等半双工模型和 Freeze-Omni 等全双工模型集成,展示了其在定时适当性和响应质量方面的卓越性能。我们的框架还表现出细粒度的风格可控性和强大的泛化性,从而实现更自然、更人性化的语音交互。