论文

CALIPER:干净的场景无法对预训练视觉表示中的物理推理进行排名

CALIPER: Clean Scenes Cannot Rank Physical Inference in Pretrained Visual Representations

模型评测评测方法与指标

摘要

被推动的物体滑动多远取决于其质量和摩擦力,而没有任何一张图像可以揭示这一点。预训练的视觉编码器越来越多地用作操作世界模型的感知前端,并且它们的身体能力通过扰动基准和线性探针进行评估,几乎总是在干净的固定摄像机场景中进行。我们表明,这些评估无法区分推断物理的编码器和不推断物理的编码器。 CALIPER(校准,然后预测)是一种直接测试:以已知速度撞击未知质量和摩擦力的物体两次,第三次撞击仅显示到接触时刻,并且冻结特征上的线性读数必须预测物体滑动的距离。交换另一个物体的校准夹可以检查证据是否被实际使用。在 2,000 个模拟场景和 8 个表示中,从 V-JEPA 2 到随机初始化的 ViT 和原始像素,校准会添加 +0.50 R^2,而交换会删除它。然而,在干净的场景中,每个表示都落在真实模拟器状态设置的上限的 0.02 R^2 范围内,因为固定相机直接在像素坐标中暴露对象的位移。对每个剪辑的摄像机、灯光和杂波进行重新采样,将相同的表示分布在 0.50 R^2 范围内;当读数选择目标距离的推动速度时,V-JEPA 2 会错失 4 毫米,随机 ViT 会错失 20 毫米,与忽略物体没什么区别。线性探针不跟踪这些:帧聚合的变化比预训练移动探针更多,并且从相同的表示中删除探测的质量方向在一个场景中不需要任何成本,而在另一个场景中则需要 0.35 R^2。基准是否可以对模型进行排名是一个经验属性,我们给出了三个检查来建立它。