论文

推测交互代理:使用异步 I/O 和推测工具调用构建实时代理

Speculative Interaction Agents: Building Real-Time Agents with Asynchronous I/O and Speculative Tool Calling

智能体系统Agent 工具调用

摘要

客户服务和个人助理等一系列下游应用对代理人工智能技术的需求不断增长。对于代理需要与人交互的应用,需要实时低延迟响应能力;例如,对于语音控制的应用程序,通常需要不到 1 秒的延迟才能实现无缝交互。但是,如果我们希望 LLM 通过工具调用来推理和执行代理工作流程,这可能会增加几秒或更长的延迟,这对于实时延迟敏感的应用程序来说是令人望而却步的。在我们的工作中,我们提出了推测交互代理,即使对于具有复杂多轮工具调用的代理也能实现实时交互。我们提出了异步 I/O,它将核心代理推理与行动线程与等待来自用户或环境的附加信息分离,从而允许在等待外部延迟时重叠代理处理。当代理仍不确定是否已收到完整信息或稍后是否可以提供其他用户信息时,我们还建议使用推测工具调用作为管理任务执行的方法。对于强大的云模型,我们的方法可以开箱即用地应用于现有的实时云 API,提供 1.3-1.7$\times$ 的加速,同时精度损失较小。为了实现与小型边缘规模模型的实时交互,我们还提出了一种基于时钟的训练方法,该方法使模型能够处理流输入和异步响应,并演示了 SFT 的合成数据生成策略。总而言之,这种方法通过 Qwen2.5-3B-Instruct 和 Llama-3.2-3B-Instruct 模型在多个工具调用基准测试中提供了 1.6-2.2$\times$ 的加速。