论文

思考、计划、绘制:统一模型中可控图像生成的布局感知推理

Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models

应用与实践内容创作

摘要

统一多模态 大语言模型 (MLLM) 为统一视觉理解和生成提供了一个有前途的范例,但它们仍然难以在可控图像生成中遵循复杂的空间指令和逻辑约束。为了解决这一差距,我们提出了 ATLAS,这是一个统一的框架,为 MLLM 配备了类似人类的“思考、计划和绘制”范式。我们采用布局作为连接三个阶段的共享表示,使模型能够推理空间需求、规划明确的对象排列并渲染最终图像。我们通过基于强化学习的布局对齐进一步提高了计划到图像的保真度。我们以 7B 和 80B 规模实例化 ATLAS,在图像生成基准上实现了 MLLM 中最先进的性能,并且比现有的基于布局的统一 MLLM 平均提高了 65.31%。在空间相关任务上,ATLAS 比基础模型平均获得了 23.06% 的增益。通过相同的布局界面,ATLAS还支持指令引导编辑和多模态定位。我们进一步介绍了 ATLAS-Reasoning,这是一个评估复杂空间指令下生成的基准。