论文
自学者应该看什么?用于策略自蒸馏的特权上下文设计
What Should a Self-Teacher See? Privileged Context Design for On-Policy Self-Distillation
摘要
更多的特权信息并不总是能成为更好的老师。我们研究了同策略自蒸馏(OPSD)中的这种张力,其中基本模型的冻结副本对学生在特权背景下自己的部署进行评分,通常是一个完整的参考解决方案,将最终答案与一个特定的推理路径捆绑在一起。将学生的观点和训练固定在每个尺度内,我们将默认值与离线编译的三个抽象、命名策略、独立于方法的框架和问题类别,以及保留目的地但删除路径的仅答案控制进行比较。在竞赛数学的初步运行中,最好的中间上下文将完整解决方案的域内峰值平均值在 4B 处提高了 1.4 个点,在 8B 处提高了 1.6 个点,同时存储的提示标记数量减少了一个数量级。三个种子的比较也显示出在两个尺度上框架和类别背景的平均增益为正。仅答案调节在初级运行中仍然具有竞争力,在这些规模上与完整解决方案的差距在 0.2 分之内。首选环境因学生规模和任务而异。初始师生KL不订购下游演出。因此,自学者应该看到的不是它能看到的一切,而是学生仍然可以采取行动的抽象水平。