论文

ProRAG:面向检索增强生成的过程监督强化学习

ProRAG: Process-Supervised Reinforcement Learning for Retrieval-Augmented Generation

模型训练强化学习

摘要

强化学习(RL)已成为在复杂推理任务中优化检索增强生成(RAG)的有前景范式。然而,传统的基于结果的RL方法常受奖励稀疏和低效贡献归因之苦,因为粗粒度标量奖励无法识别长时程轨迹中的具体错误步骤。这种模糊性常导致过程幻觉:模型经由有缺陷的逻辑或冗余检索步骤得到正确答案。尽管近期的过程感知方法试图通过静态偏好学习或启发式奖励塑形来缓解,但它们往往缺乏把步级信用与全局结果解耦所需的在线策略探索能力。为应对这些挑战,我们提出ProRAG,一个旨在把已学习的步级监督整合进在线优化循环的过程监督强化学习框架。该框架包含四个阶段:(1)监督策略预热,用结构化推理格式初始化模型;(2)构建基于MCTS的过程奖励模型(PRM)以量化中间推理质量;(3)PRM引导的推理精炼,使策略与细粒度过程偏好对齐;(4)带双粒度优势机制的过程监督强化学习。通过把步级过程奖励与全局结果信号聚合,ProRAG为每个动作提供精确反馈。在五个多跳推理基准上的大量实验表明,ProRAG相较强的基于结果与过程感知RL基线取得更优的整体性能,尤其在复杂长时程任务上,验证了细粒度过程监督的有效性。代码与模型见 https://github.com/lilinwz/ProRAG。

ProRAG:面向检索增强生成的过程监督强化学习
图3. 过程监督强化学习(Process-Supervised Reinforcement Learning)框架。