学习自回归语言模型中的记忆特征
Learning the Signature of Memorization in Autoregressive Language Models
摘要
所有先前针对微调语言模型的成员推理攻击都使用手工设计的启发式方法(例如,损失阈值、Min-K%、参考校准),每种方法都受到设计者直觉的限制。我们引入了第一个可转移的学习攻击,通过观察 微调 任何语料库上的任何模型都会产生无限的标记数据来实现,因为成员资格是通过构造知道的。这消除了影子模型瓶颈,并将成员推理带入深度学习时代:学习重要的东西而不是设计它,并通过训练多样性和规模进行泛化。我们发现 微调 语言模型产生了跨架构系列和数据域可检测的不变记忆签名。我们专门在基于 Transformer 的模型上训练隶属推理分类器。它将零样本转移到 Mamba(状态空间)、RWKV-4(线性注意力)和 RecurrentGemma(门控递归),分别实现了 0.963、0.972 和 0.936 AUC。每个评估都结合了训练期间从未见过的架构和数据集,但所有三个评估都超过了 Transformer (0.908 AUC) 上的性能。这四个系列没有共享计算机制,它们唯一的共同点是交叉熵损失的梯度下降。即使是简单的基于可能性的方法也表现出很强的转移,确认签名的存在独立于检测方法。我们的方法,学习转移 MIA (LT-MIA),通过将成员资格推断重新构建为基于每个词元分布统计的序列分类来最有效地捕获该信号。在 Transformer 上,LT-MIA 在 0.1\% FPR 下实现了比最强基线高 2.8$\times$ 的 TPR。尽管仅对自然语言文本进行训练,该方法也可以转移到代码(0.865 AUC)。代码和经过训练的分类器可在 https://github.com/JetBrains-Research/learned-mia 上找到。