论文

旋转了多少?诊断与改进 VLM 物体旋转推理

Rotated, but How Far? Diagnosing and Improving Object-Rotation Reasoning in VLMs

模型评测模型能力评测

摘要

视觉语言模型 (VLM) 可以检测对象在视图中旋转,但无法可靠地判断旋转了多少。我们引入了 OR-Bench,这是一个用于对象旋转推理的细粒度基准,具有八个任务,涵盖旋转检测、旋转幅度估计和多视图旋转推理。在 12 个 VLM 中,差距非常明显:最强的模型检测准确度接近 100%,但即使是粗略的旋转幅度估计也是 接近随机水平。当被要求提供精确的角度时,模型将 91.8--100% 的预测仅放在 $0^\circ$、$90^\circ$ 和 $180^\circ$ 上,我们将这种失败称为规范角度崩溃。即使没有视觉输入,这种崩溃也会持续存在。表征探测表明,缺失的信息只是解释的一部分。尽管旋转信息在更精细的粒度下变得难以恢复,但大量的粗粒度信息仍然存在,并且简单的线性探针优于模型生成的答案。这表明 VLM 未充分利用它们已经编码的旋转信息。因此,我们提出了 RotationCue,这是一种轻量级解码器,可以从 VLM 自身的冻结表示中恢复粗略旋转信息,并将其作为中间文本上下文反馈给模型。在三个 VLM 中,RotationCue 改进了 OR-Bench 上的每个模型-任务组合,将宏观平均准确度提高了 7.9--12.6 点,同时保留了一般功能。

旋转了多少?诊断与改进 VLM 物体旋转推理的原论文方法或结果图
图 2:OR-Bench 概述。八个任务涵盖双视图旋转理解(橙色)和多视图旋转使用(紫色),涵盖多个级别的答案粒度,从检测是否发生旋转到指定其确切角度。