论文

检索、奖励和训练协议:训练搜索代理中什么重要?

Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?

模型评测模型能力评测

摘要

由 大语言模型 提供支持的搜索代理可以通过多步推理自主分解查询、检索信息并合成答案。然而,训练方法的快速增长已经超过了受控比较的速度:现有的工作在检索语料库、奖励设计和训练协议方面存在差异,使得人们不清楚真正推动改进的因素。我们提出了一项受控实证研究,分离出搜索代理训练的三个尚未探索的维度。首先,我们在广泛使用的 Wikipedia 2018 语料库中发现了一个关键的数据覆盖问题,并表明单独纠正它比训练算法之间的差异产生更大的收益。其次,我们系统地比较了三个基本模型中基于结果和基于流程的奖励方法,发现最简单的基于结果的方法在大多数情况下都能实现竞争或卓越的绩效,并且流程级别的贡献分配可能会过度纠正代理行为。第三,我们分析训练数据多样性、离策略 数据利用率和搜索预算缩放,提炼出训练有效搜索代理的实用指南。我们的代码可在 https://github.com/YiboZhao624/SearchAgentReview 获取。