论文
大语言模型 改编的经验隐私保护基准测试
Benchmarking Empirical Privacy Protection for Adaptations of Large Language Models
摘要
最近的工作应用差分隐私(DP)来适应敏感应用程序的大语言模型(LLM),提供了理论上的保证。然而,其实际效果仍不清楚,部分原因是 LLM 预训练,尽管 DP 做出了努力,但与适应数据的重叠和相互依赖可能会破坏隐私。为了在实践中分析这个问题,我们使用最先进的攻击(例如强大的成员推理和金丝雀数据提取)来调查 LLM 中 DP 适应下的隐私风险。我们通过系统地改变适应数据分布来对这些风险进行基准测试,从与预训练数据的精确重叠,到分布内(IID)案例,再到完全分布外(OOD)示例。此外,我们还评估不同的适应方法和不同的隐私制度如何影响漏洞。我们的结果表明,分布变化强烈影响隐私脆弱性:适应数据越接近预训练分布,在相同理论保证下,即使没有直接数据重叠,实际隐私风险也越高。我们发现参数高效的 微调 方法(例如 LoRA)对 OOD 数据实现了最高的经验隐私保护。我们的基准确定了在 DP LLM 适应中实现实际隐私的关键因素,为在敏感环境中部署定制模型提供了可行的见解。展望未来,我们提出了一个超越适应隐私的整体隐私评估的结构化框架,以识别和评估 LLM 整个训练前适应管道中的风险。