论文

ReasonEdit:通过强化学习实现可解释的图像编辑评估

ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning

模型评测评测方法与指标

摘要

最近的文本引导图像编辑(TIE)模型取得了显着的进步,然而,许多编辑结果仍然存在伪影、意外修改和次优美观的问题。尽管已经提出了几种基准和评估方法,但大多数现有方法依赖于标量分数并且缺乏可解释性。这种限制很大程度上源于缺乏高质量的 TIE 解释数据集和有效的奖励模型来训练可解释的评估者。为了应对这些挑战,我们引入了 ReasonEdit-22K,这是第一个将 22K 编辑图像与 113K 思想链 (CoT) 样本相结合的数据集,以及 130 万个人类判断,用于评估这些解释的逻辑性、准确性和有用性。在此数据集的基础上,我们提出了 RE-Reward,这是一种基于多模式 大语言模型 (MLLM) 的奖励模型,旨在提供与人类一致的反馈,以评估图像编辑中的可解释推理。此外,我们开发了 ReasonEdit,它使用来自 RE-Reward 的奖励信号和组相对策略优化 (GRPO) 算法进行训练,以学习可解释的评估模型。大量实验表明,ReasonEdit 实现了与人类偏好的高度一致,并在公共基准中表现出很强的泛化能力。此外,它还能够生成高质量的可解释的评估文本,使图像编辑的评估更加透明和可信。该代码可从 https://github.com/IntMeGroup/ReasonEdit 获取。