论文

从图片和文本中学习的局限性:视觉语言模型和具身场景理解

The Limits of Learning from Pictures and Text: Vision-Language Models and Embodied Scene Understanding

模型评测模型能力评测

摘要

哪些信息足以了解人类场景理解的全部丰富性?分布假设认为,语言和图像的统计共现捕获了视觉认知基础的概念知识。视觉语言模型(VLM)在大量配对文本图像语料库上进行训练,但缺乏具体经验,这使得它们成为分布假设的理想测试。我们报告了两项实验,将 18 个 VLM 生成的描述与 2000 多名人类观察者在 15 个高级场景理解任务中生成的描述进行比较,涵盖常识、可供性、感官体验、情感反应和未来预测。由于许多任务缺乏 真值 答案,我们开发了一种人类校准余弦距离 (HCD) 指标,用于测量 VLM 输出与人类反应分布的相似性,并按人类内部变异性进行缩放。在实验 1 中,VLM 在一般知识任务上的表现接近人类水平,但在可供性任务上表现出严重的缺陷,无法及时进行工程设计,并且不会随着新模型的发布而得到改善。在实验 2 中,我们测试了六种机制假设来解释这种可供性差距,发现这种缺陷是结构性的而不是风格性的,并且不能通过提供明确的空间信息来解决。语料库分析显示,图像描述数据集包含稀疏的代理寻址语言,这与格莱斯关于为什么语言中的具身知识可能系统性地代表性不足的解释一致。总之,这些发现表明,从图像和文本中进行分布式学习不足以进行基于可供性的场景理解,这意味着人类视觉认知的某些维度可能需要那种以主体为中心的三维体验,而这是任何照片或标题都无法编码​​的。