论文

GEditBench v2:通用图像编辑的人性化基准

GEditBench v2: A Human-Aligned Benchmark for General Image Editing

模型评测基准与评测资源

摘要

图像编辑的最新进展使模型能够以令人印象深刻的真实感处理复杂的指令。然而,现有的评估框架落后:当前的基准测试任务覆盖范围狭窄,而标准指标无法充分捕捉视觉一致性,即编辑图像和原始图像之间的身份、结构和语义一致性的保留。为了解决这些限制,我们推出了 GEditBench v2,这是一个综合基准测试,包含 1,200 个实际用户查询,涵盖 23 个任务,其中包括一个专用的开放集类别,用于超出预定义任务的不受约束、分布外的编辑指令。此外,我们提出了 PVC-Judge,这是一种用于视觉一致性的开源成对评估模型,通过两个新颖的区域解耦偏好数据合成管道进行训练。此外,我们使用专家注释的偏好对构建 VCReward-Bench,以评估 PVC-Judge 与人类视觉一致性评估判断的一致性。实验表明,我们的 PVC-Judge 在开源模型中实现了最先进的评估性能,甚至平均超过了 GPT-5.1。最后,通过对 16 个前沿编辑模型进行基准测试,我们表明 GEditBench v2 能够实现更加人性化的评估,揭示当前模型的关键局限性,并为推进精确图像编辑提供可靠的基础。