论文
KitchenTwin:语义和几何基础的 3D 厨房数字孪生
KitchenTwin: Semantically and Geometrically Grounded 3D Kitchen Digital Twins
摘要
实体人工智能训练和评估需要以对象为中心的数字孪生环境,具有精确的度量几何和语义基础。最近基于 Transformer 的前馈重建方法可以有效地从稀疏单目视频中预测全局点云,但这些几何形状存在固有的尺度模糊性和不一致的坐标约定。这种不匹配阻碍了这些无量纲点云预测与局部重建对象网格的可靠融合。我们提出了一种新颖的尺度感知 3D 融合框架,该框架将通过视觉定位的对象网格与 Transformer 预测的全局点云进行配准,以构建度量一致的数字孪生。我们的方法引入了视觉语言模型(VLM)引导的几何锚定机制,该机制通过恢复准确的现实世界公制尺度来解决这种基本的坐标不匹配。为了融合这些网络,我们提出了一种几何感知配准管道,该管道通过重力对齐垂直估计、曼哈顿世界结构约束和无碰撞局部细化显式强制物理合理性。对真实室内厨房环境的实验表明,下游任务的跨网络对象对齐和几何一致性得到了改善,包括多基元拟合和公制测量。我们还引入了一个开源室内数字孪生数据集,其中包含度量缩放的场景以及语义基础和注册的以对象为中心的网格注释。