论文

AVSD:通过平衡共识和教师特定特权信号的自适应视图 Self-蒸馏

AVSD: Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals

模型训练监督微调与指令调优

摘要

Self-蒸馏 使语言模型能够通过使用与学生和教师相同的模型从自己的轨迹学习 同策略,而教师则以学生无法获得的特权信息为条件。此类信息可以有不同的类型或视图,例如解决方案、演示、反馈或最终答案。这种设置提供了密集的 词元级 反馈,而不依赖于单独的外部模型,但造成了基本的不对称:教师可能依赖于学生在推理时无法访问的视图特定信息。此外,最佳类型的特权信息通常取决于任务,因此很难选择单一的教师视图。在这项工作中,我们通过引入 AVSD(自适应视图 Self-蒸馏)来共同解决这两个挑战,AVSD 是一种具有多个特权信息视图的 self-蒸馏 的新方法,它通过将稳定的跨视图共识与视图特定的残差信号分离来重建 词元级 监督。 AVSD 识别跨视图共享的共识信号,这提供了可靠的更新方向,然后选择性地添加特定于视图的残差信号,以在与共识方向一致并与共识信号保持成比例时调整更新幅度。数学竞赛基准(AIME24、AIME25 和 HMMT25)的实验表明,AVSD 始终优于单视图自 蒸馏 基线和 GRPO,与 Qwen3-8B 和 Qwen3-4B 的最强基线相比,平均 Avg@8 分别提高了 3.1% 和 2.2%。此外,在使用 Qwen3-8B 的代码生成基准(Codeforces、LiveCodeBench v6)上,AVSD 的性能平均优于单视图自 蒸馏 基准 2.4%。