论文
VISTA:审核视觉语言模型中的语义分歧
VISTA: Auditing Semantic Divergence in Vision-Language Models
摘要
视觉语言模型可以表现出视觉概念条件的分歧:给定包含人口统计特征、公司徽标或意识形态符号的图像,某些模型会产生异常一致的响应,与同行模型对相同输入的说法不同。这些行为逃避了纯文本审核,因为视觉概念无法像文本标记那样被隔离或替换。我们提出了 VISTA(通过分析进行视觉不一致筛选),这是一种黑盒跨模型审计,它将语义熵与基于分布的散度结合起来,以标记特定于模型的异常。在一项对照研究中,我们通过 微调 在小偏差数据集上将概念条件姿态植入到三个 VLM 中,并确认 VISTA 可以检测到它们。通过审核 19 个主题的 6 个 VLM,VISTA 发现了 142 个高度可疑案例 (1.2%),并将选择性拒绝识别为以前未报告的分歧模式,其中模型拒绝人口统计查询的比率在各组中从 0% 到 65% 不等。