论文
RL之前先OPD:量规特权蒸馏热启动量规RL
OPD Before RL: Warm-Starting Rubric-Based RL with On-Policy Distillation
摘要
许多有用的语言模型任务无法用精确结果验证评估。基于量规的强化学习(RL)通过对照显式标准为开放式响应打分来解决这一问题。但因奖励在完整响应之后才赋予,训练信号无法直接识别哪些个体决策贡献了最终得分。我们提出两阶段训练框架:先把量规用作特权教师上下文提供稠密token级监督,再作为奖励做进一步RL。第一阶段量规特权在线蒸馏(RP-OPD)中,接触不到量规的学生在学生生成前缀处匹配量规感知教师的下一token分布;第二阶段RL直接优化量规奖励并超越蒸馏平台期。我们在健康与科学任务上以开放权重模型评估该框架:跨HealthBench、ResearchQA与RubricHub Science,比较后训练方法并变化RL前SFT或RP-OPD的训练量,我们的两段框架在所评估方法中得分最高。RP-OPD+RL在RubricHub Science上奖励黑客迹象有限,而SFT+RL基线日益因声称符合量规而未提供所需内容获得高分。结果支持在应用基于量规的RL之前用量规引导在线蒸馏。