论文
笛卡尔捷径:重新评估极坐标空间中的视觉推理
The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space
摘要
随着当前的多模态 大语言模型 迅速饱和规范视觉推理基准,出现了一个关键问题:这些高分是否真正反映了强大的视觉理解?我们发现了一个普遍存在的漏洞,即笛卡尔捷径:模型经常将视觉推理基准中普遍存在的基于正交网格的布局离散化为显式文本坐标,将推理从视觉感知转移到基于文本的推论。为了在这条捷径不可用时重新评估视觉推理,我们引入了 Polaris-Bench,它在极坐标空间中重新制定了 53 个视觉推理任务,并使用成对的笛卡尔对应任务来保留任务语义,从而破坏了模型利用的正交结构。对 14 美元最先进 MLLM 的综合评估表明,在笛卡尔布局上实现 $69$-$83\%$ 的前沿模型在极地等效布局上下降到 $31$-$39\%$。此外,Polar 布局上的思维收益很大程度上消失了,提示干预措施无法缩小差距,而其他非正交布局上也会出现类似的下降。这些发现表明,当前 MLLM 的视觉推理性能与正交网格结构密切相关,这种脆弱性在所有模型系列中都是一致的,但在人类中要小得多,人类在 Polar 布局上保持 88.8% 的准确率。基准测试、评估套件和排行榜可在 https://google-deepmind.github.io/polaris-bench 上公开获取。