论文
Edit-Compass 和 EditReward-Compass:图像编辑和奖励建模的统一基准
Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
摘要
最近的图像编辑模型在指令遵循、多模态理解和复杂的视觉编辑方面取得了显着的进步。然而,由于有限的任务难度和粗粒度的评估协议,现有的基准通常无法忠实地反映人类的判断,特别是对于强前沿模型。与此同时,奖励模型对于基于强化学习的图像编辑优化变得越来越重要,但现有的奖励模型基准仍然依赖于偏离实际强化学习场景的不切实际的评估设置。这些限制阻碍了对图像编辑模型和奖励模型的可靠评估。为了应对这些挑战,我们引入了 Edit-Compass 和 EditReward-Compass,这是一个用于图像编辑和奖励建模的统一评估套件。 Edit-Compass 包含 2,388 个经过仔细注释的实例,涵盖六个逐渐具有挑战性的任务类别,涵盖世界知识推理、视觉推理和多图像编辑等功能。除了广泛的任务覆盖范围之外,Edit-Compass 采用基于结构化推理和精心设计的评分标准的细粒度多维评估框架。同时,EditReward-Compass 包含 2,251 个偏好对,可在 RL 优化期间模拟现实的奖励建模场景。