论文
看到并不等于分享:一些视觉语言模型高估了非对称对话中的共同点
Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue
摘要
在协作对话中,共同的感知并不能保证共同的解释。相互理解必须通过互动建立。我们研究视觉语言模型(VLM)是否能够区分对话参与者之间通过对话共同认知建立可以共享的内容和已经共享的内容。我们将其制定为 HCRC MapTask 对话中 13,077 个带注释的参考表达式的解释匹配任务,并在对话上下文和地图信息访问的系统控制操作下评估 VLM。我们的结果表明,提供真实的地图图像可以提高整体性能,但会使模型过度预测对齐。相同地图内容的文本描述再现了这种偏差,而非信息图像完全抑制对齐预测,表明偏差是由任务相关的地图内容驱动的,而不是视觉通道。这种改进是以不对齐情况下的准确性下降为代价的。校准分析和参考链跟踪进一步表明,模型依赖于地图上的静态参考线索,而不是通过对话历史来跟踪双方如何通过对话确认共同理解。我们在 Qwen3-VL-8B-Instruct 中最清楚地观察到这些模式,并在不同程度上在两个架构系列的另外四个模型中观察到这些模式。在表现出偏见的模型中,地图内容,无论是视觉上还是文本上呈现的,都被视为相互理解的证据,将潜力与既定的共同点混为一谈。