论文

在自然阅读过程中,VLM 是否比 LLM 更适合人类?

Do VLMs Align Better with Humans than LLMs during Natural Reading?

模型评测模型行为与机制分析

摘要

大语言模型 已成为人类语言处理的越来越有用的计算模型,但视觉语言学习是否使文本表示在自然阅读过程中变得更像人类仍然存在疑问。我们通过在严格纯文本输入下比较匹配的 LLM 和视觉语言模型对来解决这个问题,并评估与人脑活动(全皮层 fMRI)和人类行为(同步回归扫视)的一致性。我们确定了视觉语言训练对人类模型对齐的选择性影响,而不是全局影响。在两个谱系内模型对中,VLM 更准确地预测人类回归性眼跳,而 VLM 和 LLM 显示出可比的全皮质 fMRI 对齐。然而,句子级分析表明,VLM 在 fMRI 对齐方面的优势随着句子的视觉唤起强度而增加。总之,这些发现提供了多模式训练历史的受控计算机比较,表明视觉语言预训练通过阅读行为和视觉基础内容选择性地改善模型与人类的对齐。