论文

开源图像编辑模型是零样本视觉学习者

Open-Source Image Editing Models Are Zero-Shot Vision Learners

模型评测模型能力评测

摘要

最近的研究表明,大型生成模型可以解决未经过明确训练的视觉任务。然而,现有的证据依赖于闭源模型〜(Veo〜3,Nano Banana Pro)或需要特定于任务的指令调整,这使得公开可用的图像编辑模型是否具有开箱即用的零镜头视觉能力尚不确定。我们对三种开源图像编辑模型——Qwen-Image-Edit、FireRed-Image-Edit 和 LongCat-Image-Edit——在密集视觉预测任务上进行了系统评估\emph{没有任何 微调}。我们对 NYUv2 和 DIODE 上的单目深度估计、NYUv2 上的表面法线估计以及 Cityscapes 上的语义分割进行基准测试,涵盖几何和语义场景理解。结果表明,开源图像编辑模型表现出非凡的零镜头视觉理解。在 NYUv2 表面法线上,FireRed-Image-Edit 的平均角度误差为 $17.69^\circ$,超过了微调的 Marigold ($20.86^\circ$),并与指令调整的 Vision Banana ($17.78^\circ$) 相匹配,而无需任何特定于任务的训练。在 NYUv2 深度估计中,LongCat-Image-Edit 通过仿射对齐获得 $δ_1{=}0.822$,而 Qwen-Image-Edit 在 DIODE Indoor 上领先 ($δ_1{=}0.868$)。在 Cityscapes 语义分割上,Qwen-Image-Edit 在 19 类级别达到 25.7 mIoU,在较粗的 7 类级别达到 49.5 mIoU。通过比较三个独立训练的编辑器,我们测试零镜头视觉能力是否是图像编辑预训练的新兴属性,而不是特定于模型的工件。代码、评估脚本和所有结果均公开发布,作为未来工作的可重复基线。