论文

利用组采样轨迹中的错误多样性进行强化学习

Leveraging Error Diversity in Group Rollouts for Reinforcement Learning

模型训练强化学习

摘要

可验证奖励的强化学习 (RLVR) 通常会对每个提示的多个响应进行采样,并根据个体的正确性分配二元奖励,但群体输出的集体结构,特别是错误的分布,在很大程度上被丢弃。我们认为这是一个错失的机会:实证分析表明,群体内的错误多样性是训练成功的有力预测因素,引发不同错误答案的问题比那些产生同质失败的问题从 RLVR 中获益更多。受这一观察的启发,我们提出了错误多样性优势塑造(EDAS),这是一种轻量级的、与算法无关的技术,它根据组内错误多样性来调节错误采样轨迹的优势信号。 EDAS 加大了对显性重复错误的惩罚力度,并减弱了对罕见的探索性错误的惩罚力度,从而鼓励模型保持多样化的推理路径并阻止错误持续存在。至关重要的是,EDAS 作为一种简单的事后调整来运行,可以无缝集成到任何 RLVR 算法中。我们在一系列模型和七个具有挑战性的数学基准的几种主流 RLVR 方法之上验证了 EDAS,展示了持续的改进。值得注意的是,在七个基准测试中,EDAS 在 Qwen3-8B 上比 DAPO 平均提高了 6.29 个点,这证实了利用组采样轨迹中的潜在信息是增强 RLVR 的广泛有效的策略。