论文

MIEScore:多源图像编辑的人性化评估

MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing

模型评测评测方法与指标

摘要

统一多模态模型的最新进展显着提高了文本引导的图像编辑能力。特别是,Nano-Banana-Pro 和 GPT-Image-2 等模型展示了多源图像编辑 (MIE) 中的新兴功能,包括对象合成、人物背景合成和跨图像风格融合等任务。然而,现有的基准和图像编辑评估 (IEQA) 方法仍然主要关注单图像编辑任务,并且在很大程度上忽视了 MIE 更具挑战性的设置。这凸显了迫切需要为 MIE 制定一个全面且人性化的基准。为此,我们引入了 MIE-Bench,这是第一个具有细粒度人类偏好注释的大规模多图像编辑基准。具体来说,MIE-Bench 包括跨 16 个任务的 3,000 个编辑实例,每个实例涉及两个以上的源图像和一个编辑提示,以及由 12 个最先进的编辑模型生成的 36K 个编辑图像和超过 108K 的平均意见得分 (MOS),涵盖视觉质量、指令遵循和属性保留。基于 MIE-Bench,我们提出了 MIEScore,一种基于多模态 大语言模型 (MLLM) 的评估模型,通过技能优化和多维监督 微调 进行增强,为 MIE 提供人性化的反馈。大量实验表明,MIEScore 在符合人类偏好方面实现了最先进的性能,并且在其他 IEQA 数据集上具有良好的泛化能力。数据集和模型均可在 https://github.com/IntMeGroup/MIEScore 上获取。