论文
CITA:长程工具智能体的比较价值估计
Choosing Before Acting: Comparative Value Estimation for Long-Horizon Tool-Use Agents
摘要
大语言模型依赖长程工具调用序列完成复杂任务,每次调用都会改变任务状态并制约后续决策。在长程工具使用中,最终结果奖励对长交互轨迹的信用分配很弱;步级奖励可提供更定向的反馈,但可靠的步级监督往往需要人工或LLM判断,或额外rollout来估计中间决策的下游影响。本文主张:有效的工具使用智能体应在执行前估计下一候选工具调用的长程价值。这一目标需要同一上下文下对备选调用的比较式监督,而日志轨迹只包含实际发生的调用。为此我们提出面向工具使用智能体的比较推理(CITA):从结合观测工具行为、贝叶斯工具图模拟器的可扩展监督与基于LLM比较的语义判断的成对信号中,训练比较推理模型(CIM)。所得CIM学会估计在当前上下文下一次候选工具调用支持最终任务成功的可能性。在三个工具使用基准与多个骨干LLM上,CITA持续提升工具F1与任务成功率;分析显示CIM对比较式工具选择学到了准确的步级价值估计。