论文
探索图像编辑模型中的视觉规划
Probing Visual Planning in Image Editing Models
摘要
视觉规划代表了人类智能的一个重要方面,特别是在需要复杂空间推理和导航的任务中。然而,在机器学习中,这种固有的视觉问题通常是通过以语言为中心的视角来解决的。虽然最近的研究证明了完全可视化方法的前景,但由于逐步的逐代规划范式,它们的计算效率显着低下。在这项工作中,我们提出了 EAR,一种编辑推理范式,它将视觉规划重新表述为单步图像转换。为了将内在推理与视觉识别分开,我们采用抽象谜题作为探索任务,并引入 AMAZE,这是一个程序生成的数据集,其特征是经典的迷宫和皇后问题,涵盖了视觉规划的独特、互补形式。 AMAZE 的抽象性质还有助于在像素保真度和逻辑有效性方面自动评估自回归和基于扩散的模型。我们评估领先的专有和开源编辑模型。结果表明,它们都在零样本设置中挣扎,基本尺度上的微调使得能够显着泛化到更大的域内尺度和域外尺度和几何形状。然而,我们在高端硬件上运行的最佳模型无法与人类求解器的零样本效率相匹配,这凸显了神经视觉推理中持续存在的差距。