论文
SCOUT:仅凭输出句法特征追溯模型蒸馏来源
Retrospective Distillation Attribution via Normalized Response Similarity
摘要
模型蒸馏通过对教师反应进行监督微调 (SFT) 来转移能力,这些反应通常从商业 API 中收集,从而引发了模型来源的问题。现有的蒸馏归因方法在 SFT 步骤之后立即对学生进行了大部分评估。然而,蒸馏模型在发布前可能会经历进一步的 SFT、偏好优化或强化学习,而审核员可能无法访问基于参考的归因所需的预蒸馏检查点。为了弥补这一差距,我们提出了 SCOUT,这是一种仅输出的方法,它将重复出现的“句法模式”聚合到候选配置文件中,过滤低对比度模式,并根据候选者之间的距离校准学生与候选者之间的距离。 SCOUT 仅支持使用当前文本进行归因和弃权,无需模型权重、标记可能性或历史检查点。 SCOUT 审核公开发布的涵盖不同训练后目标的蒸馏模型的后代,始终如一地识别蒸馏源。此外,沿着训练轨迹追踪与教师相关的“句法特征”表明,它们是在蒸馏过程中出现的,并在随后的偏好优化和强化学习中持续存在。