论文

发现多步 LLM 推理中的过程—结果信用

Discovering Process-Outcome Credit in Multi-Step LLM Reasoning

模型训练强化学习奖励建模与过程监督RLVR

摘要

强化学习(RL)是增强大语言模型(LLM)推理能力的有力范式,但标准的基于结果的方法常受奖励稀疏与低效贡献归因之苦。本文提出一个旨在提供连续奖励信号的新框架,引入逐步边际信息增益(MIG)机制,相对单调历史水印量化推理步骤的内在价值,有效过滤训练噪声。为确保解耦的贡献归因,我们实施解耦掩码策略,将面向过程的奖励专门施加于思维链(CoT),将面向结果的奖励施加于完整补全。此外,我们纳入双门控 SFT 目标,以高质量的结构与事实信号稳定训练。在文本与多模态基准(如 MATH、Super-CLEVR)上的大量实验表明,我们的方法在样本效率与最终准确率上均持续优于 GRPO 等基线。此外,我们的模型展现出更优的分布外鲁棒性,对未见且具挑战性的推理任务表现出有前景的零样本迁移能力。

发现多步 LLM 推理中的过程—结果信用
图1:所提出框架概览。我们的方法通过三个关键机制协同内在探索与严格的结果对齐:(左) Group Sampling:对每个提示,我们采样一组轨迹,并使用严格的结构标签将其解析为离散步骤。确切的提示模板与逐步生成的具体案例研究详见 Appendix A。(中) Step-wise Marginal Information Gain(MIG):我们将密集奖励 g_k 计算为相对于单调历史水印(Monotonic Historical Watermark,h_{k-1})的修正语义突破,仅严格奖励非单调的逻辑发现。(右) 解耦混合优化(Decoupled Hybrid Optimization):最终目标通过解耦掩码策略,将密集信号(用于过程探索)与稀疏正确性反馈(用于结果约束)结合,确保内在好奇心严格在正确性的边界内运行。