论文

通过扩散模型的 PAC 隐私适配保护图像合成敏感数据

Protecting Sensitive Data in Image Synthesis via PAC-Private Adaptation for Diffusion Models

模型训练参数高效训练

摘要

合成数据越来越多地用作共享敏感记录的替代方案。然而,合成数据生成并不能保证隐私,因为在敏感数据上训练或适应的扩散模型仍然容易受到重建攻击。此外,虽然使用差分隐私 (DP) 的方法(例如 DP-SGD)实现了可证明的隐私扩散模型训练,但它们所需的重复 梯度 裁剪和噪声注入会导致显着的效用损失。基于 DP 的隐私的一个重要限制是,尽管它与重建隐私 (RP) 具有可证明的关系,但这种关系是间接的。 RP 的定义是限制对手对敏感数据的后验分布与先验分布的差异程度,而 DP 通过限制输出对单个记录变化的敏感度来提供保证。这种间接性是效用损失的重要来源。为了解决这个问题,我们提出了一种 PAC-private 扩散模型来实现重建隐私。由于 PAC 隐私是直接根据相对于先验的后验优势来定义的,因此它直接涉及 RP。为了获得高维度的可扩展 PAC 私有化,我们首先使用 LoRA 或文本反转学习紧凑的数据相关扩散模型组件,然后根据重复机制输出的协方差校准各向异性高斯噪声。与 DP-SGD 不同,我们的方法在优化后仅干扰学习组件一次,从而避免了 梯度 更新之间的隐私合成。我们评估了少样本概念个性化和全数据集图像合成的框架,并表明所提出的方法比 DP 更好地保留了受试者身份、生成质量和下游分类准确性,同时实现了相同的重建隐私。