论文
边推理边推测:用联合强化学习预测Agent的下一次工具调用
Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL
摘要
大语言模型智能体常常花费大量真实时间等待工具调用结果。工具调用推测可以在预测与智能体最终工具调用一致时预先执行该调用,从而隐藏这一延迟,但现有的推测器通常是独立的草稿模型或缓存的轨迹,与被部署智能体自身的行为对齐不佳。我们识别出这种推测器-智能体差距,并表明目标智能体本身就是一个强大的下一次调用推测器。这指向一种更简单的设计:将智能体与推测器统一在同一模型中。本文提出自推测智能体(self-speculating agent),即单一模型既以智能体模式解决任务,又以推测器模式从部分轨迹预测其下一次工具调用,并完全复用前缀KV缓存。为在不降低性能的前提下实现这种双模式智能体,我们提出一种智能体-推测器联合强化学习方法,该方法从智能体自身的rollout中推导推测目标,并交替进行智能体与推测器的更新。在智能体搜索问答与对话式工具使用等智能体任务上,我们的方法将Qwen3-4B的平均下一次工具调用Hit@1从44.1提升至61.2,将Qwen3.5-4B的从48.9提升至66.3,同时保持智能体任务成功率。
