论文

单轮和多轮基于指令的图像编辑的广泛基准

An Extensive Benchmark for Single-round and Multi-round Instruction-based Image Editing

模型评测基准与评测资源

摘要

近年来,基于指令的图像编辑(IIE)领域取得了显着的进步,其重点是使用模型自动更改输入图像。然而,由于指令的复杂性和编辑的多样性,评估这些编辑模型的有效性提出了相当大的挑战。为了解决这个问题,该领域的一项紧迫任务是开发一个强大的评估框架,可以精确衡量编辑结果的质量,并为指导未来的改进提供有价值的基准。为了应对这一挑战,我们提出了一个名为 I2EBench2.0 的综合评估基准,专为 IIE 模型的单轮和多轮评估而设计。 I2EBench2.0有四个主要功能: 1)单轮和多轮评估:I2EBench2.0同时评估单轮和多轮基于指令的编辑,评估编辑的精度和一致性。 2)广泛的评估标准:I2EBench2.0包含广泛的标准,评估每个IIE模型的高层和低层方面。具体来说,它包含 16 个单轮评估维度和 7 个多轮评估维度。 3)与人类判断一致:为了确保我们的基准与人类评估一致,我们对每个标准进行了全面的用户研究。 4) 研究驱动的见解:通过分析当前 IIE 模型在所有 16 个单轮和 7 个多轮维度上的优缺点,我们提供了旨在指导该领域未来研究的关键见解。我们使用I2EBench2.0测试了最近开发的八个IIE模型,并通过细致的比较和分析得出了学术见解。所有 IIE 模型生成的相关代码、数据集和图像均可在 GitHub 上找到:https://github.com/cocoshe/I2EBench。