论文
仅在混淆的地方可检测到:关于语言模型中的成员证据,经过验证的重复计数说明了什么
Detectable Only Where It Is Confounded: What Verified Duplication Counts Say About Membership Evidence in Language Models
摘要
当语言模型发现一个句子的预测成本异常低时,很容易得出该句子在其训练数据中的结论。几乎每一个已发表的对该推论的测试都必须猜测哪些句子在训练数据中、哪些句子在成员中,哪些不在训练数据中。本文消除了猜测。两个模型系列 OLMo-2 和 Pythia 发布了它们的预训练语料库,这些语料库的公共索引会返回任何句子在每个语料库中出现的确切次数。这些计数使三个问题可以直接回答。答案形成一把钳子,从两侧闭合。在普通文本实际具有的重复级别上,从 1B 到 13B 参数的五个模型至多带有其自身曝光的微弱痕迹。我们通过两个模型读取同一个句子的设计来测量该轨迹,这通过结构消除了流畅性和质量,并且它的排名相关性接近 -0.08,其中 -1 是完美关系,0 则没有。当痕迹确实变得很明显,超过大约一千份时,两个语料库就哪些句子达成一致,因为它们是著名的句子,所以曝光率不再可以与名气分开。进一步的两项测量显示了会员信号的制造程度。建立非会员的一种常见方法是更改会员的一个单词。模型确实更喜欢原文,但无论原文出现一次还是一百次,差距都是一样的,所以模型奖励的是作者的单词选择,而不是记忆。超过一千个副本,差距随着我们可以在钳子闭合的同一边界上测试的十二个句子的模型大小而增大。将控件替换为与寄存器中的成员不同的句子会将检测器的 AUC 从 0.83 移动到 0.94,其中 0.5 是硬币翻转,1.0 是完美分离。我们发布句子库、计数和代码。