论文

GenClaw:代码驱动的代理图像生成

GenClaw: Code-Driven Agentic Image Generation

智能体系统Agent 工具调用

摘要

图像生成模型已经从文本条件像素合成发展到具有视觉理解和工具调用能力的多模式代理。然而,现有的智能体仍然受到底层黑盒图像模型的支配。他们的工作流程陷入了为生成细化而进行提示重写的重复循环中,使他们没有直接操作画布的机制。从本质上讲,LLM 作为精确视觉构建的真正“画笔”的潜力在很大程度上尚未开发。在本文中,我们提出了 GenClaw,一种代码驱动的代理图像生成范例,使代理能够像人类艺术家一样进行创作:首先概念化,然后绘制草图,最后着色。具体来说,智能体首先通过搜索和推理构建概念知识和上下文。然后,它利用代码(例如 SVG、HTML、ThreeJS)来渲染可执行的视觉草图。最后,它采用图像生成模型来补充纹理、材质和真实感。在此工作流程中,代码充当桥接语言推理和像素合成的可控中间画布,将编程逻辑与生成模型的视觉表现力无缝集成。通过将图像生成从黑盒范式转变为类似于真实人类创作的分阶段过程,GenClaw 为高度可控和可解释的视觉生成系统迈出了一步。