论文

最薄弱的环节说明了一切:通过可学习的贡献分配进行结果监督的过程奖励建模

The Weakest Link Tells It All: Outcome-Supervised Process Reward Modeling via Learnable Credit Assignment

模型训练奖励建模与过程监督

摘要

过程奖励模型 (PRM) 通过提供细粒度的反馈来增强 大语言模型 (LLM) 的推理能力,但训练 PRM 通常需要昂贵的逐步注释。结果监督的 PRM 通过仅从最终答案的正确性中学习来提供可扩展的替代方案,但这引入了基本的贡献分配挑战,即将结果归因于负责任的推理步骤。现有的方法依赖于统一分配或因果分配,这两种方法都无法将信用锚定在步骤正确性上,从而阻碍过程错误识别。在这项工作中,我们提出了通过可学习贡献分配(LCA)进行结果监督过程奖励建模,这是一种结果监督的 PRM 框架,根据最弱链接分配的原则共同学习贡献分配和奖励建模:推理链的强度取决于其最弱的链接。为了解决贡献分配和奖励建模之间的相互依赖问题,我们将结果监督 PRM 形式化为多实例学习 (MIL) 问题,并引入 Softmax 加权和 (SWS) 池化,这是一种专为推理状态之间的强依赖性和冗余而定制的 MIL 池化技术。我们在温和的假设下建立了最终学习目标的实例级贝叶斯一致性。大量实验表明,LCA 在多个任务和骨干网中的表现优于最先进的结果监督 PRM。代码可在 https://github.com/JiaTianyu20031016/MIL.git 获取。