论文

语义丰富还是几何推理? VLM 视觉不变性的脆弱性

Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance

模型评测模型能力评测

摘要

这项工作研究了基本几何变换下最先进的视觉语言模型(VLM)的根本脆弱性。虽然现代 VLM 擅长语义任务,例如识别规范方向的对象和描述复杂场景,但它们在更基本的层面上表现出系统性故障:缺乏在简单旋转、缩放和恒等变换下可靠确定对象身份所需的鲁棒空间不变性和等变性。我们通过对不同视觉领域(包括符号草图、自然照片和抽象艺术)的系统评估来证明这一局限性。随着语义内容变得稀疏,性能急剧下降,并且在架构、模型容量和提示策略中都可以观察到这种行为。总体而言,我们的结果揭示了当前 VLM 中语义理解和空间推理之间的系统差距,强调了未来多模态系统中需要更强的几何基础。