论文

DistractMIA:通过语义分散对视觉语言模型进行黑盒成员推理

DistractMIA: Black-Box Membership Inference on Vision-Language Models via Semantic Distraction

模型评测安全与风险评测

摘要

视觉语言模型 (VLM) 在可能包含私有、受版权保护或其他敏感数据的大规模图像文本语料库上进行训练,从而激发成员推理作为训练数据审核的工具。这对于已部署的 VLM 来说尤其具有挑战性,因为审核员通常只观察生成的文本响应。现有的 VLM 成员推理攻击要么依赖于此类设置中不可用的概率级信号,要么使用基于掩码的语义预测任务,其有效性取决于以对象为中心的视觉假设。为了解决这些限制,我们提出了 DistractMIA,一种基于语义干扰的仅输出黑盒框架。 DistractMIA 不是删除视觉证据,而是保留原始图像,插入已知的语义干扰项,并测量生成的响应如何变化。这种设计的动机是直觉,即成员样本仍然更锚定于原始图像语义,而非成员样本更容易被重定向到干扰项。为了使该信号可靠,DistractMIA 在参考集上校准干扰项配置,并从重复的文本生成中得出隶属度分数,捕获响应稳定性和干扰项吸收,而无需访问 logits、概率或隐藏状态。跨多个 VLM 和基准的实验表明,DistractMIA 始终优于仅输出基准和更强访问基准。它在医学基准上的表现进一步证明了其超越以对象为中心的自然图像的适用性。