论文

超越熵:通过对比策略优化形成正确性意识优势

Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)通常使用熵来塑造优势。然而,熵无法区分有用的不确定性和有害的混乱,限制了其作为正确性信号的有效性。我们提出对比策略优化(CPO),它使用 词元级 参考引导分布和普通生成分布之间的对比分歧来形成正确性感知的优势塑造。理论和实证结果都表明,这种分歧可靠地表明了 词元级 的正确性。我们进一步证明 同策略 蒸馏 是 CPO 的一个特例,其中后验分布由外部教师模型实例化。 CPO还解决了零优势问题。域内和域外基准的实验表明,CPO 大大优于基于熵的 RLVR 方法,同时保持强大的泛化性。进一步的分析表明,正确和错误的反应自然会分别支持探索和利用,平衡两者会带来最佳性能。