论文

Search-G1:通过基于表示的内在奖励的扎根搜索代理

Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards

模型训练奖励建模与过程监督

摘要

搜索增强语言代理应仅在必要时检索外部信息,并将其答案建立在检索到的证据中。现有的外部奖励要么提供稀疏的结果监督,要么提供来自过程注释和 LLM 法官的更丰富的反馈。结果奖励很容易扩展,但无法区分有根据的检索和冗余搜索,而更丰富的信号需要在训练期间进行昂贵的注释或推理。基于 同策略 侧信号(例如熵、可能性或信息增益)的内部奖励是分级的且评估成本低廉,但主要反映模型置信度而不是证据基础。我们提出了 Search-G1,一种基于表征的内在奖励框架,通过两个干预校准读数来衡量智能体答案的操作基础。即时状态读数预测闭卷充分性,其补充定义了与政策相关的检索必要性;答案提交读数估计从答案阶段敏感性到证据删除的证据可靠性。当估计需要检索且答案对证据敏感时,它们共同提供额外的信用来纠正搜索轨迹,当闭卷知识足够时,它们支持正确的直接答案,并惩罚重复搜索。校准后,奖励评分既不需要过程注释,也不需要在策略优化期间进行 LLM 作为法官推理。由于强化学习会改变策略表示,Search-G1 会定期重新调整最新检查点的轨迹读数,从而使奖励与策略共同演化。跨多个基于搜索的问答基准和两个模型规模的实验表明,Search-G1 改善了基础-搜索成本权衡,在有竞争力的任务准确性下产生更短的响应侧轨迹。代码可在 https://github.com/Rosy0912/Search-G1 获取。