论文

通过特权自我的对比强化策略优化蒸馏

Contrastive Reinforced Policy Optimization via Privileged Self-Distillation

摘要

后训练 大语言模型 (LLM) 的最新进展越来越依赖于具有可验证奖励的强化学习 (RLVR) 或 同策略 Self-蒸馏 (OPSD)。虽然 OPSD 提供密集的 logits 级监督,但由于自学者的特权信息,它本质上会受到暴露偏差的影响。在多轮代理设置中,这会导致推理路线收敛并失去明确的优化方向。为了应对这些挑战,我们引入了对比强化策略优化(CRPO),它从对比学习的角度重新阐述了代理 OPSD。通过利用预测熵来区分正位置(反射探索)和负位置(曝光偏差),CRPO 进行分组对比以保留可靠、细粒度的优化信号。对 13 个具有挑战性的推理和深度搜索基准的广泛评估表明,CRPO 始终优于现有的强化学习和自我 蒸馏 基线,显着增强了长期交互中的训练稳定性和泛化性。