论文
用于代理图像编辑的基于领域的候选选择:阴影去除案例
Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case
摘要
商业视觉语言模型正在重塑计算机视觉,其视觉先验范围足以与特定任务系统相媲美。这就提出了一个自然的问题:它们是否减少了对经典的、基于物理的底层视觉的需求?我们通过阴影去除来研究这个问题,这是一个由场景几何、照明、材质和遮挡物决定的问题,其中配对的阴影和无阴影数据很难大规模收集。我们发现直接使用商业生成编辑器可以生成干净的无阴影编辑,从而保留表面纹理和局部外观。然而,这带来了一种新的失败模式:同一个编辑器可以重新生成场景内容、幻觉对象或将阴影误读为材质或几何体,从而产生看似合理但物理上错误的编辑。我们通过代理候选选择管道来解决这个问题:编辑器生成引导探针,评估器筛选主要故障,在需要时重试,对多个候选进行采样,过滤它们,并选择平衡阴影去除和场景保留的最终结果。将这一过程建立在阴影形成物理学的基础上使其更加可靠:提示生成器和评估器将阴影视为由光遮挡引起的照明效果,而不是材料或物体结构,从而显着提高质量和一致性。在 ShadowRemovalRefine 基准测试中,我们面向物理的管道实现了 0.0075 的 CDD,比最强的现有方法减少了至少 47% 的 CDD。这些结果表明商业视觉语言模型不会取代经典的底层视觉先验;相反,此类先验对于约束和指导物理上不受约束的生成仍然有用。