论文
看到红色,想得不好:视觉语言模型中的颜色偏差
Seeing Red, Thinking Bad: Color Bias in Vision Language Models
摘要
视觉语言模型(VLM)越来越多地应用于工业决策系统,例如招聘支持和推荐。这促使人们仔细分析 VLM 如何处理视觉和文本信息。在这项工作中,我们研究了 VLM 如何解释呈现为图像的文本,并研究视觉样式偏差的影响。为此,我们引入了隐形视觉提示,它巧妙地改变文本的视觉样式,例如颜色和对比度,同时保留语义内容。使用这些提示,我们系统地控制文本中单词的视觉样式,并衡量它们对 VLM 执行的分析的影响。我们进一步分析这种视觉扰动如何影响视觉编码器的潜在表示。从我们的实验中,我们观察到将积极的单词涂成绿色会持续将情绪预测转向积极的方向。因此,VLM 常常无法正确解释文本中出现的负面词。我们的分析表明,这种行为与颜色变化引起的视觉编码器潜在表示的变化相关。此外,我们还发现,减少文本-背景对比度会增加对视觉显着线索的依赖,并导致更多不正确的视觉问答 (VQA) 输出。这些结果表明,渲染文本的视觉样式可以以不同于人类语义理解的方式指导 VLM 的解释。项目页面:https://github.com/KohsukeIde/color-bias-vlm