论文

以笔划而非像素思考:通过交错推理生成流程驱动的图像

Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning

应用与实践内容创作

摘要

人类逐步绘制图像:他们规划全局布局,绘制粗略草稿,检查和细化细节,最重要的是,每一步都基于不断变化的视觉状态。然而,在文本图像交错数据集上训练的统一多模态模型也可以想象中间状态链吗?在本文中,我们介绍了过程驱动的图像生成,这是一种多步骤范式,将合成分解为思想和行动的交错推理轨迹。我们的方法不是一步生成图像,而是通过多次迭代展开,每个迭代包含 4 个阶段:文本规划、视觉起草、文本反映和视觉细化。文本推理明确地规定了视觉状态应如何演变,而生成的视觉中间体反过来又约束并奠定了下一轮文本推理的基础。过程驱动生成的核心挑战源于中间状态的模糊性:模型如何评估每个部分完整的图像?我们通过密集的、逐步的监督来解决这个问题,该监督保持两个互补的约束:对于视觉中间状态,我们强制空间和语义的一致性;对于文本中间状态,我们保留先前的视觉知识,同时使模型能够识别和纠正违反提示的元素。这使得生成过程变得明确、可解释且可直接监督。为了验证所提出的方法,我们在各种文本到图像生成基准下进行了实验。