论文

SynthSentry:检测语言模型训练数据中的合成数据污染

SynthSentry: Detecting Synthetic Data Contamination in Language Model Training Data

AI 基础设施数据基础设施

摘要

根据自己或其他模型的输出递归训练的大型语言模型会经历模型崩溃,其中分布尾部和事实准确性恶化,而流畅性得以保留。之前的工作诊断在后训练崩溃;可操作的问题是在训练之前筛选来源不明的语料库。我们引入了 SynthSentry,这是一种语料库级别、与模型无关的污染信号,不需要访问生成模型、没有生成历史,也不需要合成标签。该分数是三个统计数据的分布散度:词汇多样性崩溃、n-gram 尾部截断和参考模型之间的困惑方差。我们评估了小型开放权重生成器和留一生成器协议下指令调整的开放权重模型污染的语料库。领域分层研究测量自然重复的人类文本(法律、临床、源代码)的误报。该分数按严重程度对语料库进行排名,当整个生成器系列都被保留时,损失很小。一旦协方差收缩和引导阈值取代了朴素分位数(其运行时间是预算的四倍),每个域的校准就会保持在其名义假阳性预算附近。一项下游微调检查显示,在我们的规模上不存在污染驱动的准确性缺陷,因此修剪是否能恢复仍然悬而未决;一旦修剪超过真实的污染分数,同样的运行显示了过度修剪的风险。我们将筛查视为一种数据管理防御,而不是事后诊断,并发布了评分工具包。所有结果均为小规模;范围是英语,批处理模式语料库筛选。污染源是单次生成或手工编写的,而不是递归生成的,因此结果通常涉及合成污染,而不是递归深度。