论文
TraversalBench:视觉语言模型的挑战之路
TraversalBench: Challenging Paths to Follow for Vision Language Models
摘要
视觉语言模型 (VLM) 在多模式基准测试中表现强劲,但其遵循复杂视觉路径的能力仍未得到测试。我们引入 TraversalBench,一个用于精确视觉路径遍历的受控基准。每个实例都包含一条连续的折线,具有唯一的起始标记和标记的顶点;模型必须恢复从开始到结束遇到的有序序列。该基准平衡了自相交计数、曲折度、顶点计数和附近的混杂线,同时限制对 OCR、世界知识或开放式规划的依赖。我们发现自相交是困难的主要来源。首次交叉分析将故障定位于交叉点:首次交叉之前性能稳定,然后当模型必须解决正确的延续问题时性能急剧下降。附近的混杂因素具有较弱但复合的影响,辅助阅读顺序基准显示出一致的从左到右的偏差。这些结果共同描述了 VLM 在视觉路径上的感知和失败方式。最后,我们将 TraversalBench 定位为对不断增长的 VLM 持续和精确视觉基础基准系列的新贡献。代码、基准数据和渲染示例可在 https://github.com/clarapetrova/traversalbench 获取。