论文

EP-GRPO:具有隐式过程指导的熵进度对齐组相对策略优化

EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance

模型训练强化学习

摘要

具有可验证奖励的强化学习 (RLVR),特别是组相对策略优化 (GRPO),具有先进的 LLM 推理能力。然而,GRPO 遭受了三个贡献分配失败:统一的 词元级 粒度忽略了异构信息价值,统一的极性惩罚正确的步骤并奖励错误的步骤,以及消除结果驱动梯度的零方差崩溃。我们系统地量化了这些失败,揭示了高度不均匀的词元信息、广泛的步级极性错位以及大量的训练浪费。为了解决这些限制,我们提出了熵-进度对齐 GRPO (EP-GRPO),这是一个挖掘模型内在信息流以获得密集、自我监督指导的框架。 EP-GRPO 集成了熵门控调制来优先考虑高熵决策枢轴、来自锚定到定向 词元级 反馈结果优势的策略分歧的隐式过程信号,无需外部奖励模型,以及累积熵映射,可实现与进度一致的优势归一化,自然地将梯度流保持在零奖励方差下。对数学推理基准的大量实验表明,与 GRPO 及其变体相比,EP-GRPO 具有更高的准确性和效率。该代码将可用。