论文
图像空间规则发现
Image-Space Rule Discovery
摘要
图像编辑模型能否发现图像空间中的视觉规则并完成端到端的问题解决?我们本着人类工作表测试(例如智商测试)的精神来解决这个问题,使用需要模型读取基于图像的指令、识别问题、推断答案、将其绑定到正确的目的地、控制输出计数、抑制不必要的编辑以及保留输入和格式的问题。我们引入了 WISRD,这是一个工作表图像空间规则发现基准,在 8 个信息条件下包含 11 个核心任务,涵盖本地化标记、填充、复制、计数和无编辑抑制,以及用于多步骤空间操作、抽象模式推理、逻辑推理和基于约束的问题解决的四个补充推理压力探针。我们确定了以下三个主要发现。 (i) 在评估的前沿图像编辑模型中,Nano Banana Pro 得分最高。在共享的 V0--V3 无参考子集上,Nano Banana Pro 的自动严格代理通过率为 48.7%,Qwen-Image-Edit 为 13.4\%,FLUX.2 Klein 4B API 为 11.5%,FLUX.2 Klein 4B open-weight 为 11.3%,InstructPix2Pix 为 0.0%。 (ii) 分析表明,即使外部提示不存在或只是通用的,当前的图像编辑模型也可以部分依赖渲染的图像内指令。 (iii) 在小型补充诊断中,Nano Banana Pro 在 4×4 数独上实现了 70.0%,在图像空间中的公共 RAVEN 模式发现项目上实现了 22.9%。