论文
视觉模型学会了物理约束,还是渲染捷径?
Do Vision Models Learn Physical Constraints or Rendering Shortcuts? A Counterfactual Benchmark for Grounded Physical Consistency
摘要
现代图像编辑模型可以满足文本指令,同时打破编辑场景的物理原理。新对象可能不会投射阴影,镜子可能无法反射可见的几何图形,或者对象可能漂浮在应该支撑它的表面上方。我们研究物理合理性诊断,检测编辑后的图像是否违反场景物理,命名违规类型,定位受影响的区域,并用语言解释失败。我们引入了一个反事实基准,其受控合成组件使用 Mitsuba~3 从 500 个场景族生成 5,500 张图像。每个系列包含一张干净的图像和十个匹配的违规行为,涉及阴影、反射、支撑、表面响应和遮挡。渲染器管道提供类别标签、受影响区域蒙版和框、场景元数据和解释目标。我们使用 LLaVA-1.5-7B、Qwen2.5-VL-7B 和 InternVL3.5-8B 作为诊断基线,而不是建议的方法。在 1,650 个图像的合成测试集上,调整后的基线在标准保留场景上达到 64.0--67.8\% 类别宏 F1。对于 LLaVA-1.5-7B,宏观 F1 类别从标准分割的 64.0% 下降到干预转移下的 40.8%。这一差距表明,高分布精度部分反映了与渲染和反事实构造相关的线索。
