论文
哪个来源获胜?视觉语言模型中任务相关的依赖
Which Source Wins? Task-Dependent Reliance in Vision-Language Models
摘要
视觉语言模型(VLM)结合了图像和文本,但是当两者发生冲突并且其中一个变得难以阅读时,尚不清楚模型如何改变它们之间的依赖。我们通过受控设置来研究这种模态重新分配:我们在四个易读性级别上降低图像或文本,同时保持另一个清晰,并跟踪模型的偏好如何变化。我们通过将一个算术问题的渲染图像与另一个算术问题的文本配对来构建 GSM8K 和 SVAMP 的冲突,因此这两个来源支持不同的答案。我们还引入了 ChartQA-Conflict,这是一个手动审核的基准,包含 229 个图表报告与匹配的图表和表格图像表示的冲突。我们使用生成的答案和长度归一化条件对数似然裕度评估六个开放权重 VLM。在 GSM8K 和 SVAMP 上,六个模型中的五个模型远离降级文本的能力比远离降级图像的能力更强。在 ChartQA-Conflict 上,所有六个似然评分模型都表现出相反的模式,更加强烈地远离退化的视觉源。在校准单峰精度损失以及用普通表格图像替换图表后,这种逆转仍然存在。两个前沿 API 模型 GPT-5.6-Luna 和 Gemini-3.5-Flash 在行为上复制了 ChartQA-Conflict 逆转,GPT-5.6-Luna 也匹配算术方向。这些结果表明,VLM 中的模态依赖不是固定的,而是随着任务、证据结构、模型和评估设置的不同而变化。源代码可在 https://github.com/Ro-netizen004/multimodal- Arbitration-artifact 获取。