论文
推理型视觉编辑
Reasoning-Informed Visual Editing
摘要
大型多模态模型(LMM)在视觉理解和生成方面取得了重大进展,但在视觉编辑方面仍然面临挑战,特别是在遵循复杂的指令、保持外观一致性和支持灵活的输入格式方面。为了研究这一差距,我们引入了 RISEBench,这是第一个评估推理通知视觉编辑 (RISE) 的基准,并将其扩展到 RISEBench++,这是针对这一新兴任务的更全面、更细粒度的基准。 RISEBench++ 将分类法扩展为跨越六个推理维度的分层方案:时间推理、因果推理、空间推理、逻辑推理和反事实推理,以及跨多轮编辑集成多种推理类型的混合推理。这些维度进一步分解为12个子类别和65个细粒度的任务类型。我们扩展了输入格式以包括多图像调节,并将基准扩展至 1000 个人工注释的测试用例,并以英文和中文发布。我们还改进了我们的评估框架,评估指令推理、外观一致性和 人类法官的视觉可信度和 LMM 作为法官的方法可实现更可靠和校准的判断。除了基准测试之外,我们还引入了 RISE-Agent,这是一个免培训的 agentic 框架,集成了推理驱动的规划、工具增强的执行和验证者引导的细化,在各种 RISE 任务中优于最强大的现有方法。我们评估了 58 种可视化编辑方法,包括 34 种开源模型、19 种闭源模型和 5 种 agentic 方法。结果揭示了基于推理的可视化编辑面临的巨大挑战,即使是最强的评估方法 GPT-Image-2.5 Sunburst,也只能达到 56.6% 的准确度。 RISEBench++ 强调了当代编辑模型的局限性,提供了见解,并指出了推理感知可视化编辑的未来方向。