论文

先计划后搜索:搜索智能体需要Plan

Plan Before Search: Search Agents Need Plan

模型训练强化学习

摘要

将大语言模型训练为检索增强推理智能体,通常将强化学习与从更强模型蒸馏而来的SFT冷启动相结合。然而,这一范式忽视了两个基本因素:子技能之间的依赖结构,以及蒸馏并非能力获取唯一途径的可能性。我们通过Plan来研究这一点——Plan是一种面向多跳检索的结构化智能体行为,在任何检索执行之前先将问题分解为有序的子问题,使每个搜索步骤都能锚定到预先设计的子问题上,而不是在先前检索到的部分相关文档的影响下漂移。然而,在横跨3B至14B参数的三个模型系列上,我们发现相同的奖励信号会诱发性质不同的RL失败模式。这一现象表明,训练能否成功不仅取决于奖励设计,还取决于模型特定的可行性条件:足够的初始熵、训练稳定性以及前置子技能。基于此,我们提出一种自举范式:由一个小规模种子模型生成经过筛选的轨迹,以在任意目标模型中激活Plan,从而无需从外部更强模型蒸馏。我们的流水线在所有受测模型上都成功激活了Plan,并在多跳问答基准上持续超越有竞争力的基线。

先计划后搜索:搜索智能体需要Plan:论文配图
图 1:与传统搜索代理的比较。 (a) 我们的方法首先生成一个全局计划,将问题分解为有序的子问题;随后的每次搜索都锚定到一个子问题,从而产生正确的答案。 (b) 如果没有计划,智能体就会根据之前检索到的结果反应性地形成每个搜索查询,并且查询逐渐偏离原始问题,从而导致错误的答案。