论文

推测执行隐藏端侧级联语音 Agent 的工具延迟

Hiding Tool Latency in On-Device Cascaded Voice Agent through Speculative Execution

智能体系统Agent 工具调用

摘要

工具增强语音助手通常将自动语音识别、大语言模型推理和外部工具执行序列化。因此,只有在用户结束讲话且 LLM 识别出所需的 工具调用 后,才会出现工具延迟。我们提出了针对设备上级联语音智能体的推测工具执行,它可以根据部分 ASR 假设预测工具请求,并在仍在接收语音时启动工具执行,从而减少端到端响应延迟。我们的方法引入了一个预测器模块,该模块在语音识别期间预测 工具调用,推测性地执行它们,并缓存结果。然后将缓存的输出注入到 LLM 提示符中,从而实现更快的响应。此外,为了减少用户在语音过程中自我纠正所造成的错误,我们采用了基于规则的验证机制,有选择地仅注入有效的缓存结果。作为最后的保障,LLM 保留了直接发出 工具调用 的能力,确保我们框架的延迟在最坏情况下以基线串行执行管道为上限。我们使用完全实现的 Android 语音助手的实时测量来评估我们的方法。我们的方法将首次音频的中值时间从 5.79 秒减少到 4.60 秒,并将标准差从 3.49 秒减少到 2.81 秒,从而产生更可预测的响应延迟。

推测执行隐藏端侧级联语音 Agent 的工具延迟:论文原图
图 2:我们的方法概述。在流式 ASR 处理期间,预测器预测潜在的 工具调用 并通过搜索 API 检索相关信息。检索到的结果存储在推测结果缓存中,并通过路径(b)直接注入到LLM中。当LLM之后发出对应的工具调用时,系统首先通过路径(c)检查验证的缓存结果。作为后备,标准工具调用工作流程通过路径 (a) 执行,对应于传统的 LLM 工具调用流程。在我们的设置中,ASR 模型在 CPU 上运行,而 W4A16 量化 LLM 在 NPU 上运行。