论文

CREval:复杂指令下创意图像操作的自动可解释评估

CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions

模型评测评测方法与指标

摘要

基于指令的多模态图像处理最近取得了快速进展。然而,现有的评估方法缺乏系统的、人性化的框架来评估模型在复杂和创造性编辑任务上的性能。为了解决这一差距,我们提出了 CREval,这是一种基于问答 (QA) 的全自动评估流程,克服了不透明的多模态 大语言模型 (MLLM) 评分的不完整性和可解释性差的问题。同时,我们推出了 CREval-Bench,这是一个专门为复杂指令下的创意图像处理而设计的综合基准测试。 CREval-Bench涵盖三个类别和九个创意维度,包括超过800个编辑样本和13K评估查询。利用这个管道和基准,我们系统地评估了一组不同的最先进的开源和闭源模型。结果表明,虽然闭源模型在复杂和创造性任务上通常优于开源模型,但所有模型仍然难以有效地完成此类编辑。此外,用户研究表明 CREval 的自动化指标与人类判断之间具有很强的一致性。因此,CREval 为评估复杂且创造性的图像处理任务的图像编辑模型提供了可靠的基础,并强调了未来研究的关键挑战和机遇。