论文

OPSD压缩RLVR教的东西:推理模型的RL后压缩阶段

OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models

模型训练监督微调与指令调优强化学习RLVR

摘要

在策略自蒸馏(OPSD)近期成为可验证奖励强化学习(RLVR)的替代:借自教师以特权上下文做token级贡献归因,许诺更高准确率与更短回复。但该许诺在启用思考的数学推理上并未兑现——报告的准确率增益缩水甚至转负。我们假设:事后监督能在短思考禁用输出中指明更好的token级替代,但在长思考启用轨迹中它更善于识别冗余而非给出更好的替代。为验证,我们把OPSD分别应用于正确与错误的rollout组,使压缩与纠正可被隔离观察。结果显示:在思考启用的数学推理中,OPSD最可靠地表现为压缩机制而非纠正机制——仅在正确rollout上训练保持准确率同时大幅缩短回复;仅在错误rollout上训练损害准确率。鉴于这些发现,我们为思考启用数学推理提出修订的后训练流水线:SFT→RLVR→OPSD。