论文
低延迟语音对话的端点预期
Endpoint Anticipation for Low-Latency Spoken Dialogue
摘要
虽然低延迟交互对于语音对话至关重要,但级联架构常常受到反应式回合完成检测的瓶颈。我们提出端点预期,从被动检测转变为主动预测转弯结束信号。我们基于语音的模型最多可提前 2.56 秒预测端点,从而能够在部分上下文上推测执行 LLM 和 TTS 管道。我们引入指标来量化已实现的延迟减少和计算冗余之间的权衡。对对话和面向任务的数据集的评估表明,我们的模型始终优于基于 VAP 的竞争基线。与 Unmute 框架的集成展示了平均延迟减少了 505 毫秒,推测计算量增加了 28.4%,有效地掩盖了顺序瓶颈,以实现实时语音交互中的复杂推理。