论文
在现实世界的对话机器人中通过上下文感知序言生成实现低延迟轮流
Low-Latency Turn-Taking via Context-Aware Preface Generation in a Real-World Dialogue Robot
摘要
基于 大语言模型 (LLM) 的对话系统会遭受响应延迟,因为生成仅在最终语音识别后才开始。虽然固定填充物是一种解决方法,但随着时间的推移它们会变得不自然。我们提出了一个两阶段增量框架,将序言响应准备与言语开始脱钩。一旦用户意图变得可预测,意图就绪检测器就会触发基于 LLM 的简短前置响应的生成。同时,语音活动投影 (VAP) 模型确定何时传送它。通过在购物中心使用路线引导机器人进行现场实验,我们评估了三种情况:无填充物、固定填充物和上下文前言。相对于无填充物,固定填充物和上下文前言都显着减少了初始响应延迟。相对于固定填充物,上下文前言的初始响应延迟明显更长,但初始到主要间隙明显更短。探索性评级没有显示显着差异。这些结果表明了时间权衡。