论文
LLM 中基于参考的 蒸馏 检测
Reference-Based Distillation Detection in LLMs
摘要
模型 蒸馏——根据更强大的第三方模型的输出进行训练——被广泛用于提高性能,但引起了对不公平优势和政策违规的担忧。这就引发了一个基本问题:我们能否检测一个模型是否是从另一个模型中提取出来的?我们表明,虽然从孤立的学生中识别教师模型非常具有挑战性,但在基于参考的环境中它变得容易处理:给定一个模型和来自同一谱系的早期检查点,我们可以识别用于训练后期检查点的教师模型。我们介绍了一种基于引用的隶属度推断的 蒸馏 检测方法。通过比较学生模型相对于参考检查点优先与不同候选教师的输出对齐的程度,我们的方法识别出最有可能的教师并检测 蒸馏 的证据。为了处理未知的 蒸馏 管道(例如隐藏提示),我们直接从模型输出推断代理提示模板。我们还识别出特定于 o1/o3 模型的独特字形级信号。评估 蒸馏 检测具有挑战性,因为现代模型谱系已经严重纠缠在一起。为了解决这个问题,我们开发了一种涵盖受控 蒸馏 实验和真实模型的混合评估。在这两种设置中,我们的方法在单教师 蒸馏 场景中以近乎完美的精度恢复了真正的教师,即使底层 蒸馏 管道很大程度上未知。我们进一步引入了教师归因和 蒸馏 检测的统计测试,并将我们的框架扩展到开放世界环境,在该环境中,保证候选人中不存在任何教师。将我们的方法应用于当代模型会产生有关涉及 QwQ、DeepSeek-R1 和 GPT-OSS 的潜在 蒸馏 关系的新证据。