论文

ArticuTable:从单个图像生成实例级交互式刚性铰接 3D 桌面场景

ArticuTable: Generating Instance-Level Interactive Rigid-Articulated 3D Tabletop Scenes from a Single Image

智能体系统Agent 环境交互

摘要

体现的智能体受益于 3D 环境,该环境将现实世界观察的视觉保真度与物理交互性相结合。现有的单图像桌面重建方法恢复了合理的场景几何形状,但通常将对象表示为整体刚体,限制了整个对象刚性运动的交互并排除了可执行的部分级关节。同时,恢复与输入视图一致的场景布局仍然具有挑战性,因为单个观察可能允许多个合理的姿态尺度配置。我们提出了 ArticuTable,一个单图像 3D 桌面重建框架,可以恢复可执行的零件级清晰度和输入视图一致的场景布局。对于对象建模,我们引入了生成鲁棒关节建模(GRAM),它将多模态大语言模型引导的关节拟合与语义状态推理相结合,以从不完美的整体代理网格中恢复可靠的关节参数和有效的运动范围,从而将它们转换为可执行的关节资产。对于场景布局,我们引入了渐进式语义几何场景配准(PSGSR),它在互补的度量、平面和输入视图约束下逐步缩小姿势尺度搜索空间,并通过结构感知语义对应解决方向模糊性,产生与输入视图一致的场景布局。我们进一步贡献了 ArticuTable-100,这是 100 个可模拟桌面场景的精选集合。包括用户研究在内的广泛评估证明了其在视觉保真度、输入视图一致性、清晰度质量、物理合理性和模拟准备度方面的强大性能。

ArticuTable:从单个图像生成实例级交互式刚性铰接 3D 桌面场景的原论文方法或结果图
图 2:ArticuTable 概述。 ArticuTable 从单个 RGB 桌面图像重建对象级 3D 代理,使用 GRAM 将可操作代理转换为可执行的 URDF 资产,并使用 PSGSR 将它们注册到模拟就绪场景中。