论文

PRO-Step:检索增强生成的步骤级过程奖励优化

PRO-Step: Step-level Process Reward Optimization for Retrieval-Augmented Generation

模型训练偏好优化

摘要

检索增强生成通过将响应基于外部知识来增强 大语言模型,但多跳推理仍然容易受到错误传播的影响,其中早期检索失败会混淆后续步骤。标准的基于结果的优化仅奖励最终答案,而不会检测到中间检索和推理错误。虽然现有的基于过程的方法引入了步骤级信号,但它们仍然根据最终答案对每个步骤进行评分,奖励虚假的成功,其中有缺陷的检索同时产生了正确的答案。 RAG 中的步骤级监督需要评估每个步骤的逻辑有效性和证据基础。我们引入 PRO-STEP:我们训练一个评估两个维度的生成 PRM,采用 PRM 引导的价值树搜索来构建偏好对,将有效步骤与有缺陷的步骤进行对比,并通过步骤级直接偏好优化来优化策略。对单跳和多跳 QA 数据集的实验表明,PRO-STEP 在五个基准测试中实现了最佳平均 EM 和 F1。代码、模型和训练数据可在 https://github.com/keemminnke/PRO-Step 上公开获取。