论文

VIMPO:LLM 的价值隐式策略优化

VIMPO: Value-Implicit Policy Optimization for LLMs

模型训练强化学习

摘要

具有可验证奖励的强化学习已成为提高 大语言模型 推理能力的核心工具,但当前方法面临简单性和贡献分配之间的权衡。 GRPO 等与组相关的方法避免训练价值网络,但通常为每个标记分配轨迹级优势。策略—价值网络方法提供更密集的学习信号,但需要具有其自身训练不稳定性的学习值函数。我们引入了 VIMPO,一种无批评的策略优化方法,它从 KL 正则化强化学习的最优条件中导出策略隐含价值函数。对于自回归生成,结果值重现可以用策略参考对数比率来编写,并由最终条件锚定,即在轨迹末端没有未来奖励。这给出了一个简单的价值损失,其中包含了结果级别的可验证奖励,而无需训练价值网络。同样的推导还产生了无价值网络的策略优势,允许 VIMPO 通过 PPO 式的策略更新通过价值损失将奖励合并与政策改进分开。在数学 RLVR 基准测试中,VIMPO 在 MATH-500、AIME 2024、AIME 2025 和 OlympiadBench 上比 GRPO 有所改进,尤其是在竞赛式评估方面取得了更大的进步。在嘈杂的奖励下,VIMPO 相对于 GRPO 保持了一致的优势,这表明策略隐含的价值优化可以提供更精细的贡献分配,同时保持无批评训练的实际简单性。