论文

视觉模型学会了物理约束,还是渲染捷径?

Do Vision Models Learn Physical Constraints or Rendering Shortcuts? A Counterfactual Benchmark for Grounded Physical Consistency

模型评测应用与实践基准与评测资源鲁棒性、公平性与可信度评测视觉感知与空间理解

摘要

现代图像编辑模型可以满足文本指令,同时打破编辑场景的物理原理。新对象可能不会投射阴影,镜子可能无法反射可见的几何图形,或者对象可能漂浮在应该支撑它的表面上方。我们研究物理合理性诊断,检测编辑后的图像是否违反场景物理,命名违规类型,定位受影响的区域,并用语言解释失败。我们引入了一个反事实基准,其受控合成组件使用 Mitsuba~3 从 500 个场景族生成 5,500 张图像。每个系列包含一张干净的图像和十个匹配的违规行为,涉及阴影、反射、支撑、表面响应和遮挡。渲染器管道提供类别标签、受影响区域蒙版和框、场景元数据和解释目标。我们使用 LLaVA-1.5-7B、Qwen2.5-VL-7B 和 InternVL3.5-8B 作为诊断基线,而不是建议的方法。在 1,650 个图像的合成测试集上,调整后的基线在标准保留场景上达到 64.0--67.8\% 类别宏 F1。对于 LLaVA-1.5-7B,宏观 F1 类别从标准分割的 64.0% 下降到干预转移下的 40.8%。这一差距表明,高分布精度部分反映了与渲染和反事实构造相关的线索。

视觉模型学会了物理约束,还是渲染捷径?:论文原图
图 1:基准和诊断基线概述。 (A) 受控渲染创建干净的场景、物理反事实以及类别、区域和解释监督。 (B) LLaVA-1.5-7B、Qwen2.5-VL-7B 和 InternVL3.5-8B 使用相同的输入和结构化输出。这些模型是基准探针,而不是建议的架构。评估分组的定义见表 1。