论文
当有用的文本有害时:视觉语言模型中的选项重定向偏差
When Helpful Text Hurts: Option-Redirecting Bias in Vision-Language Models
摘要
在三模态视觉问答(VQA)中,辅助文本通常用于补充视觉和文本输入,但其可靠性往往不受控制。虽然之前的工作总体上研究了模态冲突,但仍不清楚不同类型的不可靠辅助文本如何影响固定图像-问题-选项上下文下的答案选择。在这项工作中,我们表明,最有害的辅助文本不一定是最不符合事实的文本,而是与问题相符但与图像相矛盾并有利于特定干扰因素的文本,从而导致模型预测的系统性重定向。为了隔离这种影响,我们引入了文本可靠性阶梯,这是一种受控诊断协议,可沿三个轴分解辅助文本:图像一致性、问题相关性和选项支持。在多个数据集(ScienceQA、VCR、A-OKVQA、Causal-VidQA)和最近的 VLM 中,我们发现这种支持干扰的文本会导致最大的准确率下降(高达 53.1%),并将错误集中在特定的错误选项上。为了减轻这种故障模式,我们提出了一种免训练的推理时间干预,通过噪声稳定性转向和动态grounding明确抵消这种重定向效应,减少重定向错误,同时在很大程度上保持忠实文本下的性能。我们的结果强调,必须在决策层面理解辅助文本的可靠性,而不仅仅是通过事实正确性来理解,并为更稳健的三模态推理提供了一条实用途径。