论文
PII-VisBench:沿可见度连续体评测视觉语言模型的个人身份信息安全
PII-VisBench: Evaluating Personally Identifiable Information Safety in Vision Language Models Along a Continuum of Visibility
摘要
视觉语言模型(VLM)正日益被集成到隐私关键领域,然而现有的个人身份信息(PII)泄露评测大多将隐私视为静态抽取任务,忽略了主体的在线存在感——即其可在线获取的数据量——如何影响隐私对齐。我们提出PII-VisBench,一个包含4000个独特探测项的新基准,用于沿在线存在感连续体评测VLM的安全性。该基准依据主体可在线获取信息的范围和性质,将200名主体划分为高、中、低、零四个可见度类别。我们基于两个关键指标评测18个开源VLM(0.3B-32B):PII探测查询被拒答的百分比(拒答率),以及非拒答回复中被标记为含PII的比例(条件性PII披露率)。跨模型我们观察到一个一致模式:随着主体可见度下降,拒答增加而PII披露减少(从高可见度的9.10%降至低可见度的5.34%)。我们发现,模型对高可见度主体更容易披露PII,同时还存在显著的模型家族异质性和PII类型差异。最后,改写和越狱式提示暴露出攻击性以及依赖模型的失效,说明需要考虑可见度的安全评测与训练干预。
