论文
PiCA:面向搜索智能体强化学习的基于枢轴的贡献归因
PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning
摘要
经过强化学习 (RL) 训练的基于大语言模型 (LLM) 的搜索代理显着提高了知识密集型任务的性能。然而,现有方法在长期贡献归因中遇到了关键挑战:(i)奖励稀疏性,模型仅收到结果反馈,而没有步骤级指导来区分行动质量; (ii) 孤立信用,信用被独立分配给步骤,无法捕获顺序依赖性; (iii) 分布转变,根据偏离模型自然生成分布的模板来估计奖励。为了解决这些问题,我们提出了基于枢轴的贡献归因(PiCA),这是一种新颖的步骤奖励机制,它将搜索轨迹重新表述为累积搜索进度的连续过程。与之前的孤立步骤奖励不同,PiCA 将过程奖励定义为依赖于基于潜力的奖励塑造 (PBRS) 的历史背景的成功概率。这种方法将关键步骤(包括从历史轨迹导出的目标黄金子查询和子答案)识别为信息峰值,从而显着提高正确最终答案的可能性。通过将这些步骤奖励锚定到最终任务目标,PiCA 提供密集的、枢轴感知的和依赖于轨迹的指导,同时保持分布一致性。大量实验表明,PiCA 在七个知识密集型 QA 基准测试中的表现优于现有的强大基线,对 3B 和 7B 模型分别实现了 15.2% 和 2.2% 的改进。各种模型的一致性能提升表明了 PiCA 强大的泛化能力。该代码可在 https://github.com/novdream/PiCA 获取。
