论文
从状态到动作:面向可靠多轮工具调用的OODA-Tool
From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use
摘要
可靠的多轮工具调用要求智能体维护不断演化的任务状态,并确保每个动作与该状态保持一致。然而,直接函数调用和ReAct式策略在同一条自回归轨迹中同时学习状态跟踪和动作生成。这种耦合造成状态-动作竞争:产出下一次调用的压力可能覆盖或忽略交互中较早累积的信息。受Boyd的观察-定向-决策-行动(OODA)循环启发,我们提出OODA-Tool,一种类型化闭环策略,通过将状态保持与动作实现分离来缓解这种竞争。OODA-Tool不再直接从交互历史生成动作,而是让每个决策经过控制器检查的中间状态,确保最终输出锚定于当前任务状态。具体而言,Observe重构任务状态,Orient判断是否有必要执行,Decide形成可容许的动作结构,Act实现外部输出。我们使用0.6B到14B的Qwen3模型,在多轮、多工具和信息不完整设置下将OODA-Tool与直接函数调用和ReAct策略进行对比。OODA-Tool在各模型规模上持续提升任务成功率,且在更小模型和动作强依赖跨轮累积信息与既有工具结果的任务上收益更大。受控变体、阶段级消融和迁移评估进一步证明了这些改进的稳健性。
