论文

Lucida:解析、生成和放置可组合的实景到模拟场景建模

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

智能体系统Agent 环境交互

摘要

可组合场景建模旨在将真实的室内场景恢复为按观察到的方式排列的完整、可编辑的对象资产,为机器人模拟和体现人工智能提供真实环境的模拟就绪副本,其对象可以单独操纵。现有的管道将任务分解为三个步骤——将观察结果解析为实例,为每个实例生成资产,并将每个资产放回原处——但每一步都假定杂乱的捕获很少提供的输入:准确的实例几何形状、未遮挡的视图以及与观察结果精确匹配的资产。我们提出了 Lucida,它保留了这个顺序,但重新分配了需求,因此每个步骤仅消耗真实捕获可靠提供的内容,并且在管道末端达到精度,而不是在开始时要求精度。 Lucida 将视频解析为场景图,其节点携带每个实例的多视图证据,根据其证据为每个实例生成完整的资产,并使用 GizmoAct 放置资产,GizmoAct 是一种 VLM 策略,将放置作为多轮 GUI 交互,在闭环中操作对象的 gizmo,并在达到对齐时自行决定。在场景级 3D 对象检测、对象姿态估计和场景重建方面,Lucida 在 R2S-Scene 上比 Boxer 提高了 69%,在 CA-1M 上将 ADD-SB@0.05 从 57.8% 提高到 83.4%,并将场景 F 得分从 SAM3D 的 0.794 提高到 0.924。