论文
从 同策略 自 蒸馏 中的一般相关性到输入特定信用
From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation
摘要
同策略 self-蒸馏 已成为 后训练 语言模型的一个有前途的范例,其中模型以环境反馈为条件,充当自己的老师,提供密集的 词元级 奖励,而无需外部教师模型或步骤级注释。尽管在实证上取得了成功,但这种奖励的实际衡量标准以及它分配的信用类型仍不清楚。根据隐式奖励文献中的标准反馈条件的后验兼容性解释,我们证明自我 蒸馏 词元奖励是贝叶斯过滤增量,其轨迹总和正是给定输入的响应和反馈之间的逐点互信息。这个 pMI 可以通过输入特定的推理或输入通用的快捷方式来提出,因此我们沿着输入轴进一步分解教师对数概率。基于此分析,我们提出了 CREDIT(来自 蒸馏 的对比奖励),它将特定于输入的组件与批次对比基线隔离开来。在序列层面,CREDIT 是对比性 pMI 目标的教师端替代物,它也会惩罚在不相关输入下仍然可能出现的响应。在两个模型系列的编码、科学推理和工具使用基准测试中,CREDIT 以可忽略的额外计算提供了最强的总体性能。