论文
从只注重结果的强化学习中引入过程监督
Inducing Process Supervision from Outcome-Only Reinforcement Learning
摘要
过程奖励模型(PRM)已成为大语言模型的关键组成部分,因为它们的步骤级反馈支持训练后和测试时推理。然而,训练强大的 PRM 仍然成本高昂:人类步骤注释难以扩展,而蒙特卡洛估计的计算成本很高,并且可能会偏离步骤的内在正确性。为了以低成本获得有效的 PRM,我们引入了 TIPS(思维诱导过程监督),这是一种用于训练生成 PRM 的仅结果强化学习 (RL) 框架。在 TIPS 中,模型生成一个思想链 (CoT),后跟步骤级标签和结果标签。奖励仅取决于预测结果是否与事实相符,并且由此产生的群体相对优势用于优化整个生成的响应。直观上,当检查中间步骤有助于确定结果时,更准确的检查可以带来更好的结果判断和更高的奖励。因此,仅结果强化学习可以在没有明确过程监督的情况下加强步骤级验证。我们在数学和代理基准以及四个骨干系列中验证了 TIPS 的有效性。值得注意的是,TIPS-Qwen3-4B-Thinking-2507 在 ProcessBench 上仅用 3.2K 个结果标记轨迹就达到了 85.2 F1,超过了所有经过评估的训练有素的 PRM 和强大的仅提示判断器,例如 GPT-5.4-Instruct 和 Claude-4.7-Opus,同时仍然落后于 o1-mini。代码和数据可在 https://github.com/RUCBM/TIPS. 获取