论文

图像编辑模型理解光照吗?

Do Image Editing Models Understand Lighting?

模型评测基准与评测资源

摘要

虽然生成图像编辑模型的最新进展已经实现了令人惊叹的视觉保真度,但这些系统是否拥有真实世界照明的内在知识仍然是一个悬而未决的问题。现有的基准通常使用 VLM 或人类判断来评估策划的互联网图像上感知光传输的高级合理性,或者依赖于综合生成的数据集。在这项工作中,我们引入了 3D 锚定光探针 (3DLP) 基准,为此我们捕获了真实世界光照变化的新高保真 HDR 数据集。该数据集由 1K 个不同室内场景的图像对组成,其中光探头以物理方式打开和关闭。为了进行粒度性能分析,我们注释了特定的图像区域,例如投射阴影或金属表面。利用这些数据,我们通过测量光探针编辑与现实的吻合程度来评估一系列最先进的图像编辑模型。该评估使用两个新分数来补偿人工智能生成的摄影效果,例如调整后的白平衡。我们的结果表明,模型的整体性能差异很大,镜面高光的差异稍微不那么明显。最好的图像编辑模型与现实世界的物理现象非常一致,但是它们仍然有改进的空间。我们观察到,对于所有模型来说,从光探头接收到的光线较少的图像区域更容易出现错误。此外,基于 VLM 在评估宏观照明合理性方面的成功,我们在任务中测试了 VLM,但发现它们不适合像素级光传输分析。我们将公开该基准以及真实世界的数据集,以鼓励未来对该主题的研究。