论文

PiCA:面向搜索智能体强化学习的基于枢轴的贡献归因

PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

经过强化学习 (RL) 训练的基于大语言模型 (LLM) 的搜索代理显着提高了知识密集型任务的性能。然而,现有方法在长期贡献归因中遇到了关键挑战:(i)奖励稀疏性,模型仅收到结果反馈,而没有步骤级指导来区分行动质量; (ii) 孤立信用,信用被独立分配给步骤,无法捕获顺序依赖性; (iii) 分布转变,根据偏离模型自然生成分布的模板来估计奖励。为了解决这些问题,我们提出了基于枢轴的贡献归因(PiCA),这是一种新颖的步骤奖励机制,它将搜索轨迹重新表述为累积搜索进度的连续过程。与之前的孤立步骤奖励不同,PiCA 将过程奖励定义为依赖于基于潜力的奖励塑造 (PBRS) 的历史背景的成功概率。这种方法将关键步骤(包括从历史轨迹导出的目标黄金子查询和子答案)识别为信息峰值,从而显着提高正确最终答案的可能性。通过将这些步骤奖励锚定到最终任务目标,PiCA 提供密集的、枢轴感知的和依赖于轨迹的指导,同时保持分布一致性。大量实验表明,PiCA 在七个知识密集型 QA 基准测试中的表现优于现有的强大基线,对 3B 和 7B 模型分别实现了 15.2% 和 2.2% 的改进。各种模型的一致性能提升表明了 PiCA 强大的泛化能力。该代码可在 https://github.com/novdream/PiCA 获取。

PiCA:面向搜索智能体强化学习的基于枢轴的信用分配:论文配图
图 1:PiCA 概述。第 1 阶段是在带注释的枢轴步骤上训练 PiCA 模型(第 4.1 节)。第 2 阶段是使用 PiCA 进行策略优化(第 4.2 节)。该模型使用冻结的 PiCA 模型生成轨迹,该模型根据从成功概率 f⁡(t)f(t) 得出的相对成功增益 g⁡(t)g(t) 分配密集奖励。总奖励整合了这些逐步收益、效率惩罚和最终任务结果,而检索到的内容在训练期间被掩盖。