论文

大语言模型 中隐私和数据审计的自然标识符

Natural Identifiers for Privacy and Data Audits in Large Language Models

模型评测安全与风险评测

摘要

评估 大语言模型 (LLM) 的隐私提出了重大挑战。特别是,大多数现有的审计差异隐私的方法需要在训练期间插入特制的金丝雀数据,这使得它们在不进行昂贵的重新训练的情况下审计已经训练的模型是不切实际的。此外,如果无法访问私有非成员保留的数据集,则审计可疑数据集是否用于训练模型的数据集推断是不可行的。然而,此类保留的数据集通常无法用于或难以针对现实情况构建,因为它们必须与可疑数据来自相同的分布(IID)。这些限制严重阻碍了进行可扩展的事后审计的能力。为了实现此类审计,这项工作引入了自然标识符(NID)作为应对上述挑战的新颖解决方案。 NID 是结构化随机字符串,例如加密哈希和缩短的 URL,自然出现在常见的 LLM 训练数据集中。它们的格式允许从同一分布生成无限的附加随机字符串,这可以充当审计的替代金丝雀和用于数据集推断的相同分布保留数据。我们的评估强调,事实上,使用 NID,我们可以促进事后差分隐私审计,而无需任何重新训练,并且可以对包含 NID 的任何可疑数据集进行数据集推断,而无需私有的非成员保留数据集。