论文

通过跨模态语义对齐对视觉语言模型进行单样本黑盒成员推理攻击

Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment

模型评测安全与风险评测

摘要

视觉语言模型(VLM)取得了巨大的成功,但它们对海量数据集的依赖和对训练数据的无意记忆增加了重大的数据安全风险。成员推理攻击 (MIA) 旨在通过确定模型的训练集中是否包含数据样本来评估这些风险。然而,针对 VLM 的现有 MIA 方法面临着关键瓶颈:灰盒方法依赖于内部 logits,这通常在现实世界的应用程序编程接口 (API) 中受到限制,而黑盒方法依赖于大规模统计分布,这在单样本场景中表现不佳。为此,我们从跨模态语义对齐的角度研究 MIA,并观察到成员图像由于训练记忆而表现出明显更强的图像标题对齐,而非成员生成的标题可能会偏离原始视觉内容。利用这一见解,我们提出了一种新颖的 MIA 框架,专为严格的黑盒和单样本设置而设计,可量化联合嵌入空间内的这种对齐方式,从而绕过这些不切实际的假设。我们对三个开源和两个闭源 VLM 进行了广泛的实验。在 VL-MIA/Flicker 数据集上,我们的方法相对于 LLaVA-1.5 的 AUC 为 0.821,显着优于现有基线。此外,它在各种图像扰动下仍然保持鲁棒性,凸显了其实用性。