论文

DGPO:面向细粒度贡献分配的分布引导策略优化

DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment

模型训练强化学习

摘要

强化学习对于调整 大语言模型 执行复杂的推理任务至关重要。然而,当前的算法(例如组相对策略优化)受到粗粒度、序列级贡献分配的影响,严重难以在长的思想链生成中隔离关键推理步骤。此外,标准的无界 Kullback Leibler 散度惩罚会导致严重的梯度不稳定和模式寻求保守主义,最终阻碍新推理轨迹的发现。为了克服这些限制,我们引入了分布引导策略优化,这是一种新颖的无评论家强化学习框架,它将分布偏差重新解释为指导信号而不是严格的惩罚。 DGPO 用有界 Hellinger 距离代替不稳定的 KL 散度,以安全地量化 词元级 勘探,而不存在梯度爆炸的风险。为了有效区分真正的推理突破和幻觉噪音,我们提出了一种熵门机制,可以通过政策的认知不确定性来衡量这种偏差。通过根据这些门控分数动态地将粗略序列级优势重新分配给各个词元,DGPO 极大地激励了关键的探索步骤,同时抑制了不必要的低熵偏差。因此,DGPO 完全消除了传统的 词元级 KL 惩罚,并实现了细粒度的信用重新分配,而无需额外价值网络的计算开销。广泛的实证评估表明,DGPO 为评论家自由调整设定了新的最先进水平。值得注意的是,在 Qwen2.5-32B 架构上,DGPO 在具有挑战性的 AIME2024 和 AIME2025 基准测试中分别实现了 60.0% Avg@32 准确率和 46.0% Avg@32 准确率,大大优于 DAPO 等竞争基准。