论文
CheckMIABench:对语言模型进行成员推理攻击的坚实基础
CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models
摘要
成员推理攻击 (MIA) 是评估机器学习模型隐私属性的规范方法。尽管人们已经多次尝试在语言模型上评估 MIA,但现有文献在构建干净的评估来测试新技术方面遇到了许多困难。特别是,成员和非成员集之间微妙的分布变化可能会破坏 MIA 的统计有效性;最近的工作强调了这一点,表明无法访问底层模型的“盲”方法在相同基准上的表现比已发布的方法要好得多。本文利用训练期间固定点之前和之后的训练数据来自同一分布的见解,构建了针对 LLM 的 MIA 原则性评估的基准。因此,所有具有中间检查点和公共训练数据的开源模型都可以转换为 MIA 测试床。我们将我们的框架应用于对 Pythia 和 OLMo 系列模型的六次已发布攻击,参数范围从 70M 到 7B。为了促进进一步的隐私研究,我们开源了一个模块化库,用于在此设置中设计和实施攻击:https://github.com/safr-ai-lab/pandora_llm。