论文
对齐保护 LLM 免受属性推断攻击
Alignment Defends LLMs from Property Inference Attacks
摘要
大语言模型 (LLM) 对可能包含敏感数据集级属性的特定于域的数据集进行了越来越多的微调。最近的工作表明,此类数据集级信息可以通过属性推断攻击有效提取,从而带来保密风险。针对这些攻击的现有防御主要通过修改训练数据分布来操作,因此需要访问原始数据并重新训练模型,从而限制了它们对数据不可用或模型已部署的设置的适用性。在这项工作中,我们提出了基于对齐的防御,以减轻 LLM 中的属性推断攻击。我们的方法通过 后训练 对齐将模型的输出分布重塑为目标属性比率,而不修改训练数据。特别是,我们采用两个广泛使用的 RLHF 框架——直接偏好优化(DPO)和组相对策略优化(GRPO)——通过构建偏好对并分别定义特定的奖励函数作为我们的防御。通过全面的实验,我们表明,我们基于对齐的防御有效地减轻了属性推断攻击,同时保持了强大的实用程序机密性权衡。