论文
超越结果奖励:搜索Agent的检索反馈与信用分配
Beyond Outcome Rewards: Constructing and Assigning Retrieval Credit for Search Agents
摘要
搜索Agent使大型语言模型 (LLM) 能够迭代检索和使用复杂多跳问题的信息。具有可验证奖励的强化学习(RLVR)为此类智能体的后训练提供了一种有前途的方法,但其对稀疏、基于结果的监督的依赖可能会使学分分配变得困难并限制学习效率。在本文中,我们系统地研究了中间监督如何改进搜索Agent的强化学习。我们研究了一系列奖励塑造和信用分配策略,这些策略从中间检索步骤中提供学习信号。基于这些见解,我们开发了一个训练框架,将中间信号与最终结果奖励相结合,以改善多步搜索轨迹的学习。在匹配的训练条件下跨多个基准进行的实验证明了总体搜索Agent性能的改进,并表明中间信号的选择及其信用分配的位置都会影响训练行为。这些发现表明,奖励设计和 学分分配是训练有效搜索Agent的重要设计维度。
