论文
推理引导统一图像生成的潜在动作控制
Latent Action Control for Reasoning-Guided Unified Image Generation
摘要
统一的多模态模型可以在共享主干内编码视觉理解和图像生成,但理解不会自动转化为控制:模型可以推断对象、关系或知识线索,但无法在生成的图像中实例化它们。我们提出了潜在动作控制(LAC),它通过将推理表示为统一生成器内隐藏的连续动作来使推理变得可操作。根据提示,LAC 采样轨迹用于规划、内部视觉绘图、诊断和细化的角色结构潜在轨迹,并将这些操作注入到隐藏流中,以调节基于流的生成,而不产生推理标记或中间图像。由于此类动作轨迹是不可观察的,LAC 通过先验引导的变分潜在动作对齐(仅训练渲染的语义先验、草图图像特征和监督停止信号)来学习它们,然后通过 Latent-Flow GRPO 将潜在到图像的采样轨迹与终端视觉反馈对齐。这提供了从推断关系、绑定和知识线索到生成过程的控制路径。 LAC 在 BAGEL-7B-MoT 上实例化,持续改进 GenEval、WISE 和 T2I-CompBench 的组合和基于知识的生成,在空间关系、属性绑定和世界知识敏感提示方面获得最大收益。消融和潜在干预表明,学习到的动作轨迹被生成器消耗,这表明当理解不仅被编码,而且在生成过程中变得可操作时,统一生成会受益。