论文
你见过他们吗?通过询问 大语言模型 进行实体级成员资格推断
Have You Ever Seen Them? Entity-level Membership Inference through Interrogating Large Language Models
摘要
大语言模型 (LLM) 引发了人们对隐私泄露和版权合规日益增长的担忧。隶属推断是评估此类风险的关键工具,但现有研究主要集中在是否使用特定样本或基于样本的数据单元进行训练。我们认为 LLM 表现出类似人类记忆的行为:LLM 可能不会逐字记住特定的样本,但它可以从分散的提及中积累和揭示有关现实世界实体的知识。这个类比促使我们研究 LLM 是否可以像人类受访者一样被询问,以揭示其对实体相关信息的暴露。受这个问题的启发,我们提出了实体级成员资格推断,它确定与目标实体相关的信息是否用于 LLM 训练。我们在实际的仅标签黑盒设置中研究此任务,其中仅生成的文本是可观察的。我们在线索、输入和模型约束下将任务形式化,为其可行性建立必要和充分的条件,并基于这种形式化实例化了五种询问策略。这些策略使用有限的实体线索来构建提示,引发与实体相关的响应,并根据生成的文本之间的语义特征推断成员资格。我们构建实体级数据集,并将最先进的样本级仅标签方法适应实体级设置作为基线。对人物实体的实验表明,我们的方法的 AUC 高达 0.97,并且与最佳适应基线相比,平衡精度提高了 6.0%--17.5%。