论文

SceneConductor:通过多代理编排从单个图像生成 3D 场景

SceneConductor: 3D Scene Generation from a Single Image with Multi-Agent Orchestration

智能体系统Agent 架构与控制循环

摘要

从单个图像生成完整的 3D 场景需要从固有模糊的视觉证据中推断出全局一致的几何形状、对象关系和环境背景。尽管最近在联合布局和网格生成方面取得了进展,但现有方法通常依赖于整体或弱分解的管道,这些管道同时纠缠许多因素并需要广泛的场景级监督,限制了它们对复杂现实环境的泛化。我们提出了一个多智能体编排框架,将单图像 3D 场景生成分解为三个结构化阶段:场景初始化、环境构建和多智能体细化。初始化阶段提取图像派生的对象蒙版,构建对象级 3D 表示,并预测初始空间布局以形成粗略的 3D 场景。然后,环境构建阶段利用此初始化与点图几何图形来构建支撑表面、房间边​​界、材料和照明的环境脚手架。最后,在细化阶段,规划代理识别结构和视觉上的不一致,直接应用简单的修正,并派遣专业代理进行复杂的本地化修订,然后将其重新集成到全局场景中。为了提供可靠的结构初始化,同时减少对场景级注释的依赖,我们进一步引入了一种几何感知布局预测器,该预测器由从点图派生的稀疏几何先验监督。与完全监督的布局生成器不同,预测器可以从分段级数据进行训练,并稳健地推广到不同的现实世界场景。对基准数据集的大量实验表明,我们的方法在几何精度、空间一致性和感知真实性方面始终优于先前的方法。