论文

ForkPilot:自我进化的策略,用于长期回顾性搜索智能体

ForkPilot: Self-Evolving Policy for Retrospective Search in Long-Horizon Agents

模型推理推理搜索与路径规划

摘要

交互式语言模型智能体越来越多地通过长期、多调用推理来解决复杂的任务,其中信念或行为的错误可能会在工具交互中复合。回顾性搜索可以从此类故障中恢复,但很容易出现错误分配。延迟的结果掩盖了中间搜索决策的贡献,导致归因复杂性,而不断发展的执行证据导致适应复杂性,以前学习的估计变得过时。为了应对这些挑战,我们首先引入搜索价值动态(SVD),它描述了回顾性搜索的收益和成本之间不断变化的权衡。在 SVD 的基础上,我们提出了 ForkPilot,一个自我进化的两阶段策略学习框架。在第一阶段,ForkPilot 通过自动构建的结果比较,从完整的轨迹中离线学习搜索值策略。在第二阶段,它根据当前观察做出搜索决策,然后通过将新完成的轨迹合并到后续的策略更新中来进行自我进化。我们通过 6 个不同的基准和 7 个广泛使用的LLM骨干模型系列(包括生产Agentic系统中的四个开源系列、GPT-5.6 Sol 和 Opus 4.8)来评估 ForkPilot,并对照 9 个竞争基准(包括数十万付费用户使用的真实Harness部署)。 ForkPilot 实现了可比的最先进性能,同时将token使用量减少了高达 59.2%,证明了其功效。