论文
通过推测式宏提交加速工具使用智能体
Speculative Macro Commit for Faster Tool-Using Agents
摘要
使用工具的 LLM 代理不仅将挂钟时间花在模型推理上,而且还花在串行操作(观察轮流)上,其中每个工具调用、环境转换和观察都可能延迟后续决策。我们引入\textbf{推测宏提交}(SMC),这是一种两层代理系统的运行时机制:大型权威参与者模型产生官方轨迹,而更快的推测起草者模型在隔离环境快照上持续预测和执行未来的动作链。 SMC 从训练轨迹中挖掘重复的多动作骨架,并将它们存储在宏库中,用于与绘图者在运行时预测的动作链进行匹配。当参与者的下一个工具调用与第一个起草的操作相匹配时,SMC 会将剩余的预执行的草案步骤及其观察结果提交到官方轨迹。使用 Qwen3.5-27B INT4 作为权威参与者模型,使用 Qwen3.5-4B 作为推测起草者模型,SMC 可以匹配顺序代理的整体准确性,同时比推测操作 (SA) 基线减少 10.23% 的延迟,比 $τ^2$-Bench Telecom 子集上的顺序执行减少 18.59% 的延迟。在 AppWorld 上,SMC 比 SA 基线减少了 7.7% 的挂起时间,比顺序执行减少了 44.9%,同时任务完成率略有减少。总体而言,SMC 提供了一种实用的方法来重用多步推测执行并减少单步推测操作之外的代理延迟。我们的代码是公开的\href{https://github.com/zeyuliu1037/speculative-macro-commit}{\textcolor{magenta}{here}}。