论文

PACE:基于 LLM 的全双工语音对话的播放对齐上下文引擎

PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue

上下文与知识上下文工程

摘要

基于LLM的全双工语音服务允许用户在助理响应时讲话。由于服务器可以比客户端播放它更快地生成输出和推进对话状态,因此后续的用户语音可能会根据用户从未听过的内容进行解释。我们将这种失败称为生成上下文错误锚定(GCM)。为了解决 GCM 问题,我们提出了 PACE,这是一个独立于提供者的中间件层,它将面向模型的上下文锚定到客户端播放边界,以系统可观察的播放进度代表用户可能已听到的内容。中断后,PACE 会修复此上下文,以排除从未播放的助手内容,同时在异构语音运行时保持低延迟生成。我们使用黑盒语音模型在基于浏览器的实时语音助手中端到端地实现 PACE 的纯音频投影路径,而无需修改模型服务。我们还构建了 GCM-Bench,这是一个新的受控基准数据集,包含 108 个回放相关参照物锚定案例。在 GCM-Bench 上,PACE 将参考锚定准确度从仅取消基线的 25.0% 提高到 96.3%。在 200 个 Full-Duplex-Bench v1 中断样本上,它保留了中断响应质量。这些结果表明,在实际播放中将面向模型的上下文与实际播放对齐是保持全双工语音对话一致性的实用方法。