论文
RC-OPD:根因引导的在线策略蒸馏
Learning from Repaired Reasoning: Root-Cause-Guided On-Policy Distillation
摘要
在线自蒸馏(OPSD)以参考解为特权后见监督学生自生成的推理轨迹。但基于参考的指导可能只解释正确解而不处理学生自身推理为何失败——所供指导与所需纠正之间的推理错配会诱使学生借用正确结论而任其推理错误未解;且沿轨迹施加同一后见还有蒸馏陷阱之险——对有效推理的不必要约束会与实质错误的纠正竞争。为此我们提出根因引导在线蒸馏(RC-OPD):用对学生自身推理的修复提供既针对其具体错误、又建立在有效进展之上的指导。对每次失败尝试,RC-OPD定位最早的实质错误、开发局部修正、并以修正后的中间结果作为有效前缀的锚。迭代"诊断-修复-续写"过程通过学生续写检验修复,在固定修复预算内识别进一步错误。对抵达正确答案的修复链,根因引导蒸馏以失败诊断与纠正目标监督错误片段,锚引导蒸馏以通向修复中间结果的推理链支撑相应有效前缀。我们在多数据集与模型规模上评估RC-OPD:大量实验与分析显示其缓解推理错配与蒸馏陷阱,带来显著的性能增益。