论文
反思性视觉生成的基准测试和进化 Reason-Reflection-Rectify
Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation
摘要
文本到图像(T2I)模型和统一多模态模型(UMM)在视觉生成方面取得了显着的进展。然而,他们对单遍生成范例的依赖限制了他们处理需要迭代细化的复杂提示的能力。为了实现多轮反射视觉生成(RVG),我们将原因-反射-纠正(R^3)循环形式化为核心框架,并引入 R^3-Bench,这是一个包含 600 多个专家注释实例的基准,可量化迭代推理和纠正能力。对 R^3-Bench 的评估揭示了一个关键差距:虽然最先进的模型可以识别生成错误,但它们无法生成可操作的纠正指令。为了弥补这一差距,我们提出了 R^3-Refiner,这是一个利用组相对策略优化 (GRPO) 和分层奖励机制 (HRM) 的双阶段框架,以更好地将整改与反思推理结合起来。实验表明,R^3-Refiner 在 R^3-Bench 的基础上取得了显着的改进(Reflective Verdict Score +12.0%,Reflection Score +9.0%),并且可以与各种 MLLM 无缝集成,以提高 GenEval++ 和 T2I-CompBench 上不同 T2I 模型的生成质量。代码可在 https://github.com/xiaomoguhz/R3-Bench 获取。