论文
重新思考奖励监督:量规条件化自蒸馏
Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation
摘要
推理语言模型的后训练通常由监督蒸馏与可验证奖励强化学习驱动。蒸馏常依赖获取昂贵、且本身可能带噪、不完整或部分错误的思维链标注——即使最终解正确——不完美的理据也可能干扰学习。而可验证奖励强化学习通常把评估反馈压缩为标量信号——掩盖响应的哪些方面应被改进。我们提出量规条件化自蒸馏——把量规作为结构化、细粒度反馈纳入自策略自蒸馏的框架。我们的方法以准则级量规条件化教师模型——并用其在学生自己采样的轨迹上提供token级引导。该设计避免把单一参照理据当作唯一监督目标。相反——量规规定强响应应满足什么——使推理过程的信用分配比标量奖励优化更细粒度。我们以两阶段管线实例化该框架:先学习生成任务专属量规——再训练量规引导的推理器。我们在多样的科学推理基准套件上评估——结果表明量规条件化自蒸馏有效把量规级准则转为推理过程的token级引导——平均超GRPO 1.0分、超OPSD 0.9分。
