论文
难度估计策略优化
Difficulty-Estimated Policy Optimization
摘要
以 DeepSeek-R1 为代表的大型推理模型(LRM)的最新进展,凸显了通过组相对策略优化(GRPO)扩展推理时计算的潜力。然而,当遇到过于简单或过于复杂的问题时,GRPO 经常出现梯度信号衰减。在这些情形下,组间优势的消失使梯度信号易受噪声影响,从而危及收敛稳定性。虽然 DAPO 等变体试图纠正梯度消失,但它们并未缓解对低效用样本穷尽式 rollout 所带来的巨大计算开销。本文提出难度估计策略优化(DEPO),一个旨在优化推理对齐的效率与稳健性的新框架。DEPO 集成了一个在线难度估计器,在 rollout 阶段之前动态评估并过滤训练数据。这一机制确保计算资源优先分配给学习潜力高的样本。实验结果表明,DEPO 在不损害模型性能的前提下,rollout 成本最多降低 2 倍。我们的方法显著降低了训练高性能推理模型的计算门槛,为推理扩展提供了更可持续的路径。代码与数据将在论文被接收后发布。
