论文
PRAISE:以轨迹前缀复用和中间奖励训练搜索智能体
PRAISE: Prefix-Based Rollout Reuse in Agentic Search Training
摘要
在代理搜索中,大语言模型 (LLM) 经过训练,可以对复杂任务(例如多跳问答 (QA))执行多轮检索和推理。然而,当前基于搜索的强化学习(RL)方法存在两个核心限制:训练期间昂贵的长期部署未得到充分利用,并且监督通常仅在最终答案时可用,从而导致严重的奖励稀疏。我们提出了基于前缀的 Rollout 重用,用于具有中间步骤奖励(PRAISE)的代理搜索,这是一个用于提高代理搜索训练中的数据效率和贡献归因的框架。给定完整的搜索轨迹,PRAISE 在不同的搜索轮次中提取前缀状态,从中得出中间答案,并使用这些前缀来构建额外的训练轨迹,并从前缀之间的性能差异中获得阶梯级奖励。我们的方法使用单个共享模型进行搜索策略学习和前缀答案评估,从而无需额外的人工注释或单独的奖励模型即可实现联合优化。多跳 QA 基准实验表明,与强基准相比,PRAISE 持续提高性能。
