论文
视觉语言模型在模糊输入下抑制女性表征
Vision-Language Models Suppress Female Representations Under Ambiguous Input
摘要
一致性教会视觉语言模型(VLM)避免表达人口统计偏见,当性别清晰可见时,它们基本上会成功。对于模棱两可的输入(全副武装的工人,从后面看到的人物)知之甚少,这种情况在实践中很常见,但很少进行研究。我们发现,当提示模棱两可的输入图像时,最小的提示压力会暴露职业性别默认值,即使对于强烈的女性刻板印象的职业,模型也会崩溃为男性。但这些输出是否反映了模型内部实际编码的内容?我们引入了 LALS(潜在关联学习得分),这是一种零样本度量,它将视觉标记激活投影到模型的文本嵌入空间中,以测量每个标记和层的概念关联。在 15 个职业、超过 800 个性别模糊图像和 4 个 VLM 中,内部表征和输出通常会系统性地脱钩:模型通常在内部编码女性关联,但输出男性关联。逐层分析揭示了一个不对称滤波器:男性信号端到端放大,而女性信号在网络中间达到峰值,并在生成之前被抑制。颜色消融表明,文化负载的视觉线索(例如服装颜色)进一步调节了这些内部关联。