论文

Harness-1:具有状态外化测试架的搜索智能体强化学习

Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses

智能体系统模型训练上下文与知识强化学习记忆Agent HarnessAgentic RLAgent记忆

摘要

搜索代理通常被训练为不断增长的记录的策略:模型必须决定如何搜索,同时还要记住它所看到的内容,哪些证据是有用的,哪些约束仍然开放,以及哪些声明已经实际检查过。我们认为,这种表述在策略中放入了过多的常规状态管理:强化学习被迫优化语义搜索决策和环境可以更可靠地维护的可恢复簿记。我们引入了 Harness-1,它是一个 20B 搜索代理(检索子代理),在状态搜索工具内接受强化学习训练。该工具维护环境端工作记忆,包括候选池、带有重要性标记的精选集、紧凑的证据链接、验证记录、压缩和重复数据删除的观察结果以及预算感知上下文渲染。该策略保留语义决策:搜索什么、保留或丢弃哪些文档、验证什么以及何时停止。在涵盖网络、金融、专利和多跳 QA 的八个检索基准中,Harness-1 实现了 0.730 的平均策划召回率,比第二强的开放搜索子代理高出 +11.4 分,并与更大的前沿模型搜索器保持竞争力。它的收益在保留的迁移基准上尤其强劲,这表明在显式搜索状态上的强化学习可以产生泛化到训练领域之外的检索行为。我们的代码可在 https://github.com/pat-jj/harness-1 获取。

Harness-1:具有状态外化测试架的搜索智能体强化学习:论文配图
图 1:八个具有挑战性的搜索基准的平均性能。每种方法报告:策划集回忆和轨迹回忆(剧集中任何地方遇到的文档)。 Harness-1 是我们的 20B 开放搜索代理,经过状态化 Harness 训练;它比开放搜索代理有了显着的改进,并且与更大的前沿模型搜索器相比仍然具有竞争力。