论文
没有记忆就没有检测:基于输出分布的小语言模型污染检测
No Memorization, No Detection: Output Distribution-Based Contamination Detection in Small Language Models
摘要
CDD(即通过输出分布进行污染检测)通过测量模型采样输出的峰值来识别数据污染。我们研究了这种方法在 70M 到 410M 参数的小型语言模型上成功和失败的条件。通过在 GSM8K、HumanEval 和 MATH 上进行受控污染实验,我们发现 CDD 的有效性关键取决于微调是否会产生逐字记忆。通过低秩适应,模型可以从受污染的数据中学习而无需记住它,并且即使数据被可验证地污染,CDD 也会在机会水平上执行。只有当微调能力足以引起记忆时,CDD 才能恢复很强的检测精度。我们的结果描述了控制可检测性的记忆阈值,并强调了一个实际考虑因素:参数有效的微调可能会产生输出分布方法无法检测到的污染。我们的代码位于 https://github.com/Sela-Omer/Contamination-Detection-Small-LM
