论文
视觉语言模型中不同语言否定理解的差异
Disparities In Negation Understanding Across Languages In Vision-Language Models
摘要
视觉语言模型 (VLM) 表现出肯定偏差:即使正确的描述包含否定(“没有 X”),也会选择积极的说明文字(“存在 X”)。虽然之前的工作已经用英语记录了这种失败模式并提出了解决方案,但否定在不同的语言中通过不同的词法、词序和附属模式表现得不同,这就提出了这些解决方案是否公平地服务于所有语言社区的问题。我们引入了第一个经过人类验证的多语言否定基准,涵盖七种类型不同的语言:英语、普通话、阿拉伯语、希腊语、俄语、他加禄语和西班牙语。通过评估三种 VLM(CLIP、SigLIP 和 MultiCLIP),我们发现标准 CLIP 在非拉丁文字语言上的表现等于或低于机会,而 MultiCLIP 实现了最高且最一致的准确度。我们还评估了 SpaceVLM(一种提议的否定校正),发现它对多种语言(尤其是英语、希腊语、西班牙语和他加禄语)产生了显着的改进,同时在不同类型的语言中显示出不同的有效性。这种变化揭示了形态、脚本和否定结构等语言特性以与公平相关的方式与模型改进相互作用。随着 VLM 在全球范围内部署,多语言基准对于了解解决方案是否有效以及对谁有效至关重要。