论文

从困难提示词中学习:动态采样中的难度感知优势放大

Learning from Hard Prompts: Difficulty-aware Advantage Amplification in Dynamic Sampling

模型训练强化学习RLVR

摘要

解耦剪辑和动态采样策略优化 (DAPO) 是组相对策略优化 (GRPO) 的一个重要变体。 DAPO 对 GRPO 进行了多项改进。其中,动态采样相对于 GRPO 对 DAPO 精度提升的贡献最大。为了提高准确性,动态采样通过从零优势消除零策略梯度来增强训练稳定性。具体来说,它通过过滤掉采样响应完全正确或不正确的提示来避免这种零梯度。然而,我们的理论分析表明,动态采样会降低训练效率,因为它无法有效利用硬提示上难以采样的正确响应。从形式上来说,它不对称地放大了对相同提示的不同反应的优势。在硬提示下,不正确的反应比正确的反应受到更大的放大。这导致模型避免生成观察到的错误响应,而不是利用硬提示上难以采样的正确响应,从而导致训练效率低下。为了提高训练效率,我们提出了直接优势放大(DAA),它放大了通过动态采样获得的硬提示上难以采样的正确响应的优势。这确保了在使用动态采样时,可以有效地利用这些难以采样的响应,从而意味着更高的训练效率。通过将 DAA 集成到 DAPO 中,我们获得了难度感知优势放大策略优化(DA3PO),该优化从 DAPO 中用不到 30 行代码实现。实验表明,DA3PO 的性能显着优于 GRPO 和其他经典 GRPO 变体。