论文

TECCI:收集和策划图像的棘手编辑

TECCI: Tricky Edits of Collected and Curated Images

模型评测基准与评测资源

摘要

尽管最近取得了巨大进步,但当前的文本引导图像编辑方法仍然在编辑的许多方面遇到困难,包括遵循指令、最小化源图像编辑以及确保高视觉质量。当所请求的编辑具有挑战性时,例如涉及位置、运动、视点、比例和创意编辑的编辑,这些问题尤其明显。为了系统地测试生成图像编辑器,我们提出了一种新颖的图像编辑基准——TECCI:收集和策划图像的棘手编辑。 TECCI 包含我们正在发布的一组全新图像。 TECCI 中的图像涵盖 7 个图像类别。这些图像和这些类别是专门针对现有方法的弱点而设计的。 TECCI 中的编辑指令由 Gemini 自动生成,涵盖每个源图像 5 种编辑类型。我们还策划了一组 530 张图像,并为其创建了具有挑战性的手动编写的编辑说明。总体而言,TECCI 包含 7550 对图像和编辑指令。我们对 TECCI 上的五种领先图像编辑模型进行了人工评估。人类从三个维度判断输出:1) 遵循指令,2) 编辑的最少程度,以及 3) 视觉质量。为了扩大评估范围,我们还使用 Gemini 构建了一个自动评估器,在匹配人类评估方面达到了 74.7% 的准确率。我们的评估表明:1) 没有一个模型的总体成功率超过 22%,这证明了 TECCI 的挑战性,2) Nano Banana Pro 是总体上表现最好的模型,3) 与最少的编辑和视觉质量相比,模型在遵循指令方面的表现明显更好,4) 模型在编辑建筑和自然图像方面遇到了困难,这需要对空间布局和复杂的视觉细节有深入的了解。 5) 推理和创意编辑是最困难的,而颜色和外观编辑是最容易的。