Leak It:超越聚合成员资格推断的每个文档提取
Leak It: Per-Document Extraction Beyond Aggregate Membership Inference
摘要
语言模型上的成员推断(MIA)通常通过聚合 ROC-AUC 来概括,但这种评估是令人困惑的:无模型的盲基线可以仅使用表面文本将成员与非成员分开。在概率可发现提取的基础上,我们使用来自 p_theta(. | x) 的 N 个样本来研究黑盒训练数据泄漏,将平均重叠、极值重叠和自我集中放在共同的函数估计基础上。在 WikiMIA 上,盲词袋分类器达到了 AUC 0.97(5% FPR 时的 TPR 0.90),而采样却没有增加任何效果。在 IID 堆分裂 (MIMIR) 上,自我浓缩和金连续回收总体上均未显着超过盲基线。聚合指标隐藏了真正的危害:逐字提取训练数据以获得盲目攻击无法触及的文档尾部。在 Pythia-6.9B 上,500 个带有真实标识符的 Pile 文档中的 16.6%(83 个文档;其中 21.3% 带有电子邮件地址)已复制该标识符,而在不匹配的前缀控制下则未复制该标识符。每次泄漏都可归因于该文档而不是全局通用字符串。每个文档的披露对于聚合 AUC 是不可见的。风险是不均匀的:代码中的标识符泄漏比散文强约 3 倍,尽管散文仍然是积极的并且随着容量的增长而增长(从 4.0% 到 12.1%,从 410M 到 6.9B);任意保留延续的恢复本质上仅限于代码(GitHub 上的成员差距为 +0.44,而散文上的成员差距最多为 +0.014)。温度和核采样影响较小,16 个词元前缀就足够了,样本预算关系证实了先前的概率提取结果。我们发现重复数据删除没有减少。隐私审计应该报告每个文档的提取,而不仅仅是聚合成员资格,并激励差异隐私作为缓解措施。我们发布了leakit,这是一个实现该探测器及其控制的黑盒工具。