论文
当话语压力发生冲突时:视觉语言模型输出中的信息结构
When Discourse Pressures Conflict: Information Structure in Vision-Language Model Outputs
摘要
视觉语言模型(VLM)越来越多地被评估是否能够识别正确的视觉内容,但人们对它们是否以适合话语的形式表达这些内容知之甚少。我们使用信息结构(IS)来解决这一研究差距,测试 VLM 是否在视觉基础的问答中区分话语旧主题和话语新焦点。我们利用匈牙利语,这是一种将主题和焦点映射到专用句法位置的语言,使 IS 选择在文本中可见。将六个 VLM 与人类参与者进行比较,我们发现模型产生与 IS 相关的结构,但过度规范了这种敏感性。在话语状态、语法角色(对主题主题的偏好)和确定性(对不定焦点的偏好)的相互作用的压力下,人类选择不同的IS实现策略。相比之下,VLM 会崩溃到狭窄的响应模板上,类似于模式崩溃(Kirk 等人,2024)。我们的研究结果表明,VLM 评估应该超越内容准确性,而关注如何为话语打包内容。