论文
超越感知错误:大型视觉语言模型中的语义固定
Beyond Perception Errors: Semantic Fixation in Large Vision-Language Models
摘要
大型视觉语言模型(VLM)通常依赖于熟悉的语义先验,但现有的评估无法将感知失败与规则映射失败明确区分开。我们将这种行为研究为语义固定:即使提示指定了替代的、同样有效的映射,也保留默认解释。为了隔离这种影响,我们引入了 VLM-Fix,这是一种针对四种抽象策略游戏的受控基准,可在成对的标准和逆规则公式下评估相同的端子板状态。在 14 个开放式和封闭式 VLM 中,准确性始终有利于标准规则,揭示了强大的语义固定差距。及时干预支持这种机制:中性别名提示大大缩小了逆规则差距,而语义加载的别名则重新打开它。 后训练 具有很强的规则对齐性:对一条规则的训练可以改善相同规则的迁移,但会损害相反规则的迁移,而联合规则的训练可以改善更广泛的迁移。为了测试合成游戏之外的外部有效性,我们评估了 VLMBias 上的类似陌生化干预措施,并观察到相同的定性模式。最后,后期层激活控制部分恢复了降低的性能,这表明语义固定错误在后期表示中至少部分是可编辑的。项目页面、代码和数据集可在 https://mavern.github.io/vlm-fix/ 获取。