论文

可编辑的视觉设计

Editable Visual Design

智能体系统Agent 架构与控制循环

摘要

虽然 GPT-Image-2 和 Nano-Banana 等扩散基础模型表现出卓越的视觉表现力,但它们的端到端生成本质上会产生带有容易出错的文本的扁平位图,从而妨碍了逐层后期编辑。相反,通过 编码智能体 基于代码的视觉生成提供了精确的布局控制和解耦层,但仍然受到缺乏全局审美直觉和编码复杂视觉资产的难度的限制。为了解决这个问题,我们提出了可编辑视觉设计,这是一种由 编码智能体 驱动的新范例。我们将 VLM 指定为用于需求理解、任务规划和审美判断的“创意大脑”,同时利用图像生成模型作为按需“视觉世界模拟器”来合成独立的视觉资产。该代理在“先想象,然后行动”的闭环工作流程下运行,生成独立的资产,编写本机 HTML/CSS,并根据视觉渲染反馈迭代地完善设计。此外,Agent Design Replay 忠实地再现了类似于专业人类设计师的创意和推理轨迹。最终,该系统提供具有解耦层和真实文本的可编辑工件,使用户能够在图形用户界面上执行直观的鼠标拖动和布局调整。对海报、信息图表和其他场景的验证表明,这种范例成功地实现了精致的美学和生产级的可编辑性。