论文
G-Drift MIA:通过梯度引起的特征漂移检测训练集成员
G-Drift MIA: Membership Inference via Gradient-Induced Feature Drift in LLMs
摘要
大语言模型 (LLM) 经过大规模网络规模语料库的训练,引发了人们对隐私和版权日益增长的担忧。成员推断攻击 (MIA) 旨在确定训练期间是否使用了给定示例。现有的 LLM MIA 在很大程度上依赖于输出概率或损失值,并且当成员和非成员从同一分布中抽取时,其性能通常仅比随机猜测稍好一些。我们介绍 G-Drift MIA,一种基于梯度引起的特征漂移的白盒成员推断方法。给定候选 (x,y),我们应用单个目标梯度上升步骤,增加其损失并测量更新前后内部表示的变化,包括 logits、隐藏层激活和到固定特征方向的投影。这些漂移信号用于训练轻量级逻辑回归分类器,该分类器可以有效地将成员与非成员分开。在多个基于 Transformer 的 LLM 和源自实际 MIA 基准的数据集上,G-Drift 的性能大大优于基于置信度、基于困惑度和基于参考的攻击。我们进一步表明,记忆的训练样本比非成员系统地表现出更小、更结构化的特征漂移,从而提供了梯度几何、表示稳定性和记忆之间的机制联系。总的来说,我们的结果表明,小型的、受控的梯度干预为审计训练数据的成员资格和评估 LLM 中的隐私风险提供了实用的工具。