论文
协同规划和渲染:用于视觉文本生成的自回归布局和扩散的 DeepFusion
Planning and Rendering in Concert: DeepFusion of Autoregressive Layouts and Diffusion for Visual Text Generation
摘要
根据提示生成富含文本的图像需要文本保真度以及文本与周围图像的连贯集成。明确的布局可以提供有关文本应出现在何处的结构化指导,但仅靠格式良好的计划并不能保证渲染器能够忠实地实现它。现有的基于布局的 AR 扩散系统通常会分别优化规划和渲染,从而阻止规划器的表示与图像合成一起进行调整。我们介绍 DuetGen,一种基于 DeepFusion 构建的自主视觉文本生成器,它共同学习自回归规划和连续扩散渲染。 DeepFusion 在规划器的提示和 bbox 内容隐藏状态上设置扩散变换器,允许渲染监督来塑造连接文本计划与视觉输出的表示。其联合目标结合了自回归计划监督、文本区域加权扩散学习和辅助坐标监督,以维持结构化规划、强调文本承载区域并提高规划器表示的空间精度。在推理过程中,相位感知注意力调制增强了图像区域与其匹配的坐标和内容状态之间的对应关系,从而促进生成计划的特定区域执行。借助 2B 规划器和 4B 单流 DiT,DuetGen 在 CVTG-2K 上实现了 0.8293 的单词准确率,在 LongText-Bench 上实现了 0.938 的准确率,在两个基准测试中与大得多的 Qwen-Image 非常接近。这些结果证明了联合学习规划表示和特定区域渲染对于自主视觉文本生成的价值。