论文
CoCo:以代码为思维链的文生图预览与稀有概念生成
CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation
摘要
统一多模态模型 (UMM) 的最新进展显着推进了文本到图像 (T2I) 的生成,特别是通过思想链 (CoT) 推理的集成。然而,现有的基于 CoT 的 T2I 方法很大程度上依赖于抽象的自然语言规划,缺乏复杂空间布局、结构化视觉元素和密集文本内容所需的精度。在这项工作中,我们提出了CoCo(Code-as-CoT),这是一种代码驱动的推理框架,它将推理过程表示为可执行代码,从而为图像生成提供了明确且可验证的中间规划。给定文本提示,CoCo 首先生成指定场景结构布局的可执行代码,然后在沙盒环境中执行以渲染确定性草图图像。该模型随后通过细粒度图像编辑来完善该草稿,以产生最终的高保真结果。为了支持这种训练范例,我们构建了 CoCo-10K,这是一个包含结构化草稿最终图像对的精选数据集,旨在教授结构化草稿构建和矫正视觉细化。对 StructT2IBench、OneIG-Bench 和 LongText-Bench 的实证评估表明,CoCo 比直接生成实现了 +68.83%、+54.8% 和 +41.23% 的改进,同时也优于 CoT 授权的其他生成方法。这些结果表明,可执行代码是一种有效且可靠的推理范例,可用于精确、可控和结构化的文本到图像的生成。代码位于:https://github.com/micky-li-hd/CoCo
