论文
EDGE-OPD:用证据引导的在线策略蒸馏内化特权上下文
EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation
摘要
在线策略蒸馏(On-Policy Distillation, OPD)作为一种LLM后训练范式受到广泛关注,因为它能在提升能力的同时不引入模型分布漂移,进而避免通用任务的性能回退。在线策略自蒸馏(OPSD)是OPD的一种高效用例,其吸引力在于只需单一模型即可兼任学生与教师,并且能在训练过程中向教师提供推理时缺失的特权上下文(如人设、隐私事实或完整解答)。这一做法的挑战在于,特权信息对模型行为的改变可能超出预期:它会修改推理、削弱通用能力,并影响响应长度、风格或局部token偏好等性能指标。结果,OPSD可能让学生学到的是副作用,而非期望的可迁移行为。本文在稀有token/身份设定下研究该问题,提出证据引导的在线策略蒸馏(EDGE-OPD),它是对OPSD的改造,具有两个鲜明特征:a)使用引导式rollout在采样时向学生注入特权上下文行为,使稀有目标行为确实出现在在线策略数据中;b)应用证据掩码:仅在特权上下文支持所采样token的位置上更新学生,而非rollout中的每个token。我们以实验证明,OPSD(及其变体RLSD,无论是否配备验证器)完全无法学到目标身份,而引入引导式rollout后则能成功。此外,掩码区域消融表明人设信号局限于正证据尾部,这为我们提供了关于高效知识迁移与通用能力保持的宝贵洞见。
