论文

Traverse:学习何时记住、重置和重定向以进行长期网络搜索

Traverse: Learning When to Remember, Reset, and Redirect for Long-Horizon Web Search

智能体系统Agent Harness

摘要

长期信息寻求主体经常会积累噪音或误导性的背景信息,导致早期错误持续存在,并使恢复变得越来越困难。我们引入了一种自主搜索Harness,其中Agent通过三种状态管理自己的搜索过程:Rubric、Answer 和 Verify。Agent首先定义有效答案的标准,根据这些标准进行搜索,然后独立验证结果,然后决定是否终止或继续搜索。它还配备了 Seal Memory 工具,可实现主动上下文管理。然而,通过强化学习训练这种行为可能会导致 Seal Collapse,从而导致训练不稳定并阻止智能体可靠地学习何时以及如何使用其记忆工具。我们通过一个简单的策略来解决这个问题,该策略仅训练上下文管理后的最后一段。我们的 35B 模型在 BrowseComp 上取得了 72.83 的成绩,优于同类开源系统,并且在 BrowseComp-ZH、xbench、DeepSearchQA、WideSearch、财务调查和产品搜索方面持续改进基础模型。消融表明自主压缩优于自动压缩并验证了我们的 RL 设计。