论文
AIR-OPD:从演化错误学习的自适应迭代修复蒸馏
Learning from Evolving Errors: Adaptive Iterative Repair for On-Policy Distillation
摘要
在线自蒸馏(OPSD)在学生自采样的轨迹上提供稠密token级反馈——比强化学习的结果级奖励更丰富的训练信号。该反馈来自以完整参考解为条件的教师,而参考解只指定目标,不指明如何从学生当前错误走向目标,产生解条件捷径风险。我们提出AIR-OPD,为在线蒸馏提供"错误到修复"监督的自适应迭代修复框架:给定失败响应,指导生成器为当前错误合成修复指导;学生按该指导在策略重试;若重试仍错,生成器为新观察到的错误产出新的修复指导。每轮固定教师以指导为特权上下文,在学生最新失败响应的错误对齐区域上监督学生。结果感知的阶段加权偏袒早期修复阶段,并奖励即时重试通过验证的阶段。我们在DAPO-Math-17K上训练AIR-OPD,在AIME24、AIME25、HMMT25及MMLU-Pro、GPQA分布外测试上评估,考察学生自指导与更大模型外指导两种来源:Qwen3-4B与Qwen3-8B上AIR-OPD均取得最佳数学推理均值,较最强基线最高提升3.6点,同时保持分布外基准上的基座性能。