论文

可读但不可预测:视觉语言模型中的旋转结果预测

Readable Yet Unpredictable: Rotated-Outcome Prediction in Vision-Language Models

模型评测基准与评测资源

摘要

视觉语言模型能否预测 180° 旋转会从原始图像中揭示什么?我们通过旋转结果预测来研究这种能力:给定原始图像,模型必须回答 180° 平面内旋转后会看到或读取到的内容,而无需直接观察旋转的目标。为了弥补这一差距,我们引入了 RotOutBench,这是一个跨越开放视觉案例和受控文本图像旋转的配对诊断基准。一个明显的模式出现了:许多 VLM 在直接给出原始图像或旋转图像时可以识别相关内容,但无法单独从原始图像推断旋转结果。在受控的文本图像旋转中,即使对于具有高直读精度的模型,预测旋转精度也会崩溃到接近零。模型级案例研究进一步表明,预测状态可以接近旋转图像读取状态,而最终读数仍然偏向原始字符串。当前的 VLM 可以在显示时识别变换后的视觉状态,但通常无法从原始视图预测该状态。