论文

CPI-Bench:全面、实用、智能的真实图像编辑基准

CPI-Bench: A Comprehensive, Practical and Intelligent Benchmark for Real-World Image Editing

模型评测基准与评测资源

摘要

随着图像编辑模型的快速发展及其在各个领域的广泛应用,将这些模型能力直接部署到现实场景中的需求越来越迫切。然而,现有的基准测试仍然仅限于简单的单图像任务,受到覆盖维度有限且无法有效区分不同模型之间性能的影响。因此,他们无法可靠地评估复杂的多图像编辑、高要求的推理指令和实际部署设置中的模型性能。为了解决这些限制,我们提出了 CPI-Bench,这是一个用于现实世界图像编辑的全面、实用和智能的基准。 CPI-Bench包含三个核心子集: CPI-General-Bench,全面覆盖多样化编辑任务,引入多图像编辑评估; CPI-Practical-Bench,专注于高频真实用户应用场景; CPI-Intelligent-Bench,致力于评估高要求的基于推理的编辑能力。基于CPI-Bench的主流图像编辑模型的评测结果表明,CPI-Bench增强了模型之间的性能差异化。它对通用编辑能力、实际部署效能和基于推理的高级编辑方面的差距提供了全面、可靠的量化,为未来图像编辑模型的优化提供了宝贵的指导。至关重要的是,我们的排名分析表明,CPI-Bench 与 Arena Image Edit 排行榜的一致性最高,表明与公众人类偏好排名具有更强的一致性,可以作为公众人类评估的有效代理。