论文

幻象与披露:审计合成数据隐私的统计框架

Phantoms and Disclosures: A Statistical Framework for Auditing Privacy in Synthetic Data

模型评测安全与风险评测

摘要

生成式 AI 和 大语言模型 (LLM) 的快速采用激发了人们对合成数据的兴趣,将其作为敏感现实世界数据集的隐私保护替代方案。然而,生成高实用性的合成数据通常会带来记忆和反省训练语料库中的私人信息的风险。在这项工作中,我们提出了一个可定制的实证审计框架,旨在检测和解释此类数据披露。我们的框架引入了一种机制来区分“真实披露”(系统直接再现用户的信息)和“虚假披露”(系统偶然生成用户数据)。通过将输入数据划分为训练集和保留集并应用严格的统计假设检验,我们确定观察到的披露是否与严格的隐私基线一致,例如零学习或特定的差分隐私(DP)界限。至关重要的是,这种方法不需要模型访问,不需要金丝雀插入,也不需要参考模型训练 - 仅合成输出和保留的控制集,我们证明该框架可以有效地发挥成员推理攻击的作用,提供比先前基于数据的审计方法更严格的经验下限,我们的方法与模型无关,适用于任何合成数据生成机制,并且比影子模型或基于金丝雀的替代方案需要更少的计算资源。