论文

形式与虚空:通过自主人工智能Agent进行纠缠组合

Form and Void: Entangled Composition through an Autonomous AI Agent

智能体系统Agent 架构与控制循环

摘要

正负空间是视觉构图的基本原则,支持视觉连贯的形式和分层的语义关系。生成这样的组合具有挑战性,因为它需要对共享共同边界的两个语义概念进行协调控制。尽管最近的文本到图像模型和多模态大语言模型(MLLM)在图像生成和视觉理解方面取得了强大的性能,但正负空间生成仍然很困难,特别是在直接单遍提示下。在这项工作中,我们提出了 Form and Void Agent (FaV-A),这是一种为分阶段正负空间生成而设计的多模态Agent。 FaV-A 遵循渐进式工作流程:它首先生成一个基础对象,然后分析其形状和空间结构以识别候选负空间语义,最后为最终图像生成阶段生成构图指令。实验结果和消融分析表明,FaV-A 提供了比直接零样本 MLLM 基线更有效的框架,用于生成视觉连贯且语义对齐的正负空间组合。