论文
LMOPD:字典序多目标在线蒸馏
Lexicographic Multi-Objective On-Policy Distillation
摘要
可验证奖励的强化学习(RLVR)通常优化答案正确性,但有用的语言模型行为还需要高质量推理与简洁响应。现有多奖励后训练方法通常对标量化的奖励做加权或组合专家,而不显式保护奖励优先级。当权衡不对称时这是有问题的:例如简洁性不应以牺牲正确性为代价。我们提出字典序多目标在线蒸馏(LMOPD),在显式优先级下整合奖励专门化策略的多教师方法:对每个学生rollout,LMOPD选择其门检测到不足的第一个目标的专家,然后局部投影其中心化对数策略校正,移除与更高优先级专家相悖的分量。我们在三个数学基准上以两教师与四教师设置评估30B-A3B混合专家transformer,度量保留的专家增益。两专家下,LMOPD的点估计完整保留准确率与推理质量增益,并获得46.9%的简洁性增益;四教师下保留约90%的准确率与推理正确性增益,而次佳基线仅约57%。匹配的四教师消融显示字典序路由优于随机路由,投影进一步强化最高优先级能力。两种规模下LMOPD都比所评估的现有基线更有效地保留最高优先级能力,证明显式优先级对专家整合的价值。