论文
教学视觉语言模型使用给定的量表:用于度量物理推理的无标签等方差训练
Teaching Vision-Language Models to Use the Scale They Are Given: Label-Free Equivariance Training for Metric Physical Reasoning
摘要
有关视频的度量问题需要视觉语言模型使用提供的现实世界参考将视觉测量结果转换为物理单位。然而我们发现当前的模型仅部分使用了该尺度信息。当提示中的每个世界空间量按一个公因子重新调整比例时,视频仍然同样有效,并且正确答案会根据该因子发生变化,但模型预测仅移动一部分,并且准确性仍然集中在所描绘对象的熟悉比例附近。在八种视觉语言模型中,这种响应不足的情况持续了四个数量级以上。当以无标度形式询问相同的物理学时,相同的模型恢复了正确的封闭式标度定律,这表明主要缺陷在于度量基础而不是物理机制知识。我们使用这种精确的缩放关系作为监督,而不需要度量注释。在所提供的世界空间量的常见重新缩放下,正确的度量答案必须改变相同的因子。 EquiSD 通过将模型自身的预测投影到尺度等变族上并将 微调 模型投影到结果目标上来利用此约束。它不需要 真值 答案,每个训练视频只需要一个模型查询。在保留的模拟视频上,EquiSD 将 3B 模型的中值响应斜率从 0.66 增加到 0.94,并将跨尺度的平均相对准确度提高了 9.2 个点。学习到的关系可推广到看不见的世界尺度和传输,无需适应真实的 QuantiPhy 视频,准确度提高了 6.4 个点。这些结果表明,精确的物理对称性可以提供无标签监督,以改善视觉语言模型中的度量基础。