论文
IV-CoT:用于结构感知文本到图像生成的隐式视觉思想链
IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation
摘要
统一多模态 大语言模型 (MLLM) 已经实现了强大的文本到图像生成质量,但仍然难以实现结构感知的提示跟踪,其中必须保留对象计数、空间关系、属性绑定和粗略布局。我们将这种限制部分归因于单个调节流中结构规划和外观渲染的纠缠。为了解决这个问题,我们提出了隐式视觉思想链(IV-CoT),这是一种用于查询条件图像生成的潜在视觉推理框架。 IV-CoT 将视觉条件查询分解为结构到语义的级联,其中结构查询首先形成潜在的视觉计划,语义查询然后根据该计划渲染外观。为了指导结构查询,我们引入了仅训练草图监督,这鼓励他们从草图捕获结构,而无需在推理时提取草图或中间解码。 IV-CoT 在单次前向传递中执行隐式 CoT 推理,并在 GenEval 和 T2I-CompBench 上取得优异的结果。可视化和分析表明,学习到的结构和语义查询在结构感知生成中发挥着补充作用。