论文
通过闭环验证推理解锁复杂的视觉生成
Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning
摘要
尽管进步很快,当前的文本到图像(T2I)模型主要依赖于单步生成范例,该范例难以应对复杂的语义,并且面临参数缩放带来的收益递减的问题。虽然最近的多步骤推理方法显示出希望,但它们受到缺乏验证的无根据的规划幻觉、单一的事后反思、长上下文优化不稳定性和令人望而却步的推理延迟的阻碍。为了克服这些瓶颈,我们提出了闭环视觉推理(CLVR)框架,这是一个将视觉语言逻辑规划与像素级扩散生成深度耦合的综合系统。 CLVR 引入了具有步骤级视觉验证的自动化数据引擎来合成可靠的推理轨迹,并提出了代理提示强化学习 (PPRL),通过将交错的多模态历史提炼为明确的奖励信号以实现准确的因果归因来解决长上下文优化不稳定性。此外,为了缓解迭代去噪造成的严重延迟瓶颈,我们提出了$Δ$-空间权重合并(DSWM),这是一种理论上有依据的方法,它将对齐权重与现成的 蒸馏 先验融合在一起,将每步推理成本降低到仅 4 个 NFE,而不需要昂贵的重新 蒸馏。大量实验表明,CLVR 在多个基准测试中均优于现有开源基线,并接近专有商业模型的性能,从而解锁了复杂视觉生成的一般测试时间缩放功能。