论文
发现多步 LLM 推理中的过程—结果信用
Discovering Process-Outcome Credit in Multi-Step LLM Reasoning
摘要
强化学习(RL)是增强大语言模型(LLM)推理能力的有力范式,但标准的基于结果的方法常受奖励稀疏与低效贡献归因之苦。本文提出一个旨在提供连续奖励信号的新框架,引入逐步边际信息增益(MIG)机制,相对单调历史水印量化推理步骤的内在价值,有效过滤训练噪声。为确保解耦的贡献归因,我们实施解耦掩码策略,将面向过程的奖励专门施加于思维链(CoT),将面向结果的奖励施加于完整补全。此外,我们纳入双门控 SFT 目标,以高质量的结构与事实信号稳定训练。在文本与多模态基准(如 MATH、Super-CLEVR)上的大量实验表明,我们的方法在样本效率与最终准确率上均持续优于 GRPO 等基线。此外,我们的模型展现出更优的分布外鲁棒性,对未见且具挑战性的推理任务表现出有前景的零样本迁移能力。
