论文

CEPO:RLVR Self-蒸馏 使用对比证据策略优化

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

模型训练强化学习

摘要

当模型在具有可验证奖励的强化学习(RLVR)下产生正确的解决方案时,每个标记都会收到相同的奖励信号,无论它是决定性推理步骤还是语法填充。一个自然的解决方法是将模型作为教师以正确答案为条件,识别如果知道答案的话它会以不同方式生成的标记。先前的工作表明,这要么通过将答案泄漏到梯度中来破坏训练,要么产生无法区分决定性步骤和填充物的微弱信号,因为相对于模型的基线,两者看起来同样令人惊讶。我们提出对比证据策略优化(CEPO),它对每个标记提出更尖锐的问题:而不仅仅是“正确答案是否支持该标记?”但是“正确的答案是否有利于它,而错误的答案是否有利于它?”满足两者的词元是真正的推理步骤;两者都不满足的就是填充物。错误答案教师是根据训练批次中已被拒绝的首次展示构建的,不会产生额外的采样成本。我们证明,CEPO ​​继承了现有技术的所有结构安全保证,同时严格提高关键词元的信用度,而改进恰好在填充位置消失。根据经验,CEPO ​​在 2B 和 4B 规模的五个多模态数学推理基准上分别实现了 43.43% 和 60.56% 的平均准确度,而在相同的训练预算下,GRPO 的平均准确度为 41.17% 和 57.43%。分布匹配自 蒸馏 方法(OPSD、SDPO)低于未经训练的基线,从经验上证实了我们理论预测的信息泄漏。我们的代码可在 https://github.com/ahmedheakl/CEPO ​​获取。