论文
推测执行隐藏端侧级联语音 Agent 的工具延迟
Hiding Tool Latency in On-Device Cascaded Voice Agent through Speculative Execution
摘要
工具增强语音助手通常将自动语音识别、大语言模型推理和外部工具执行序列化。因此,只有在用户结束讲话且 LLM 识别出所需的 工具调用 后,才会出现工具延迟。我们提出了针对设备上级联语音智能体的推测工具执行,它可以根据部分 ASR 假设预测工具请求,并在仍在接收语音时启动工具执行,从而减少端到端响应延迟。我们的方法引入了一个预测器模块,该模块在语音识别期间预测 工具调用,推测性地执行它们,并缓存结果。然后将缓存的输出注入到 LLM 提示符中,从而实现更快的响应。此外,为了减少用户在语音过程中自我纠正所造成的错误,我们采用了基于规则的验证机制,有选择地仅注入有效的缓存结果。作为最后的保障,LLM 保留了直接发出 工具调用 的能力,确保我们框架的延迟在最坏情况下以基线串行执行管道为上限。我们使用完全实现的 Android 语音助手的实时测量来评估我们的方法。我们的方法将首次音频的中值时间从 5.79 秒减少到 4.60 秒,并将标准差从 3.49 秒减少到 2.81 秒,从而产生更可预测的响应延迟。
