论文

SpatialGuard:用于文本到图像生成的Harness引导的可验证空间推理

SpatialGuard: Harness-Guided Verifiable Spatial Reasoning for Text-to-Image Generation

智能体系统Agent Harness

摘要

复杂的 3D 空间文本到图像的生成需要模型将自然语言转换为稳定的视觉几何形状,而不仅仅是语义外观。现有的提示驱动或布局条件方法提高了可控性,但在视觉采样之前往往缺乏可优化和可验证的空间中介。因此,对象关系、遮挡、可见性和相机约束可能会在多轮生成过程中衰减。本文介绍了 SpatialGuard,这是一种用于复杂 3D 空间文本到图像生成的结构化布局引导框架。 SpatialGuard 通过 Spatial Layout Architect 将提示解析为面向图像合成的 3D 布局,通过 Visual Realizer 将它们实现为视觉条件和候选图像,并使用 Visual Alignment Critic 来验证提示、布局和图像之间的一致性。为了在迭代中保持约束稳定,SpatialGuard 引入了布局框架,它围绕可编辑布局状态组织规则约束、工具调用、共享知识和反馈循环。该设计将复杂的空间生成从隐式提示转变为可验证的规划、实现、验证和修复过程。综合实验表明,SpatialGuard 在复杂的 3D 空间布局生成方面实现了最先进的性能,并在现有的文本到图像和布局控制基线上改进了空间 忠实性。