论文
DP^2-VL:通过视觉语言模型的数据中毒保护私人照片数据集
DP^2-VL: Private Photo Dataset Protection by Data Poisoning for Vision-Language Models
摘要
视觉语言对齐方面的最新进展赋予了视觉语言模型(VLM)细粒度的图像理解能力。然而,这一进展也带来了新的隐私风险。本文首先提出了一种名为身份关联学习的新型隐私威胁模型:攻击者仅使用目标个人的几张私人照片来微调 VLM,从而将目标面部身份与其私有财产和社会关系之间的关联嵌入到模型的内部表示中。一旦通过公共 API 部署,该模型就可以在输入目标用户的照片时未经授权地暴露其私人信息。为了衡量 VLM 对此类身份归属泄露的敏感性,我们引入了第一个身份归属数据集,其中包含私人照片中出现的七个典型场景。每个场景都用多个以身份为中心的照片描述对进行实例化。实验结果表明,LLaVA、Qwen-VL 和 MiniGPT-v2 等主流 VLM 可以在小规模私人摄影数据集甚至综合生成的数据集上通过 微调 识别面部身份并推断身份隶属关系。为了减轻这种隐私风险,我们提出了 DP2-VL,这是第一个利用数据中毒的私人照片数据集保护框架。虽然通过将原始表示推向对立区域来优化难以察觉的扰动,但 DP2-VL 会在 VLM 编码器的嵌入空间中引起数据集级别的移位。这种转变将受保护的图像与干净的推理图像分开,导致受保护集上的 微调 过度拟合。大量实验表明,DP2-VL 实现了跨模型的强大泛化性、对不同后处理操作的鲁棒性以及在不同保护率下的一致有效性。