论文
SelfSearch:无奖励搜索自我改进的Agent
SelfSearch: Reward-Free Search for Self-Improving Agents
摘要
LLM Agent编码能力的进步使他们能够检查和修改自己的指令、工具和执行程序。现有方法利用这种能力通过重复的下游评估来搜索改进的Agent,这会产生大量成本并将搜索与评估的任务联系起来。我们引入了 \textbf{SelfSearch},这是一种无奖励的搜索过程,其中Agent使用以前的自我改进事件的记录来修改自己。这些记录捕获了早期修改尝试的推理、工具操作和结果,为改进任务解决和自我修改提供了具体经验。在搜索过程中没有下游奖励信号的情况下,SelfSearch 在所有六个模型基准设置中比初始Agent提高了群体平均成功率,单个Agent在 Terminal-Bench 2.1 上获得了高达 11.2 个百分点的成功。在 SWE-bench Multilingual 上,对于初始Agent和进化Agent解决的任务,Agent将成功率提高了 \textbf{5.0} 个百分点,同时将执行成本降低了 \textbf{38.5}\%。 SelfSearch 通过评估引导的搜索基线以较低的搜索成本实现了竞争性任务的成功。在搜索成本仅为 \textbf{\$4.03} 的情况下,它生成的工具可在公共九项工具比较的设置下使用 DeepSeek V4 Flash 解决 \textbf{82.0}\% 的 Terminal-Bench 2.1 任务,与得分最高的工具 Codex 相匹配。这些结果表明,通过自我修改获得的经验可以提高Agent商的下游能力和效率。