论文
FOUND-IT:基础模型优先、任务驱动的 3D 场景图,具有按需粒度
FOUND-IT: Foundation-model-first Task-driven 3D Scene Graphs with Granularity on Demand
摘要
我们提出了第一种使用未校准的单目相机实时构建任意室内或室外环境的分层任务驱动的 3D 场景图的方法。我们利用几何基础模型来估计场景图的几何属性(例如,对象边界框),但我们也观察到,可通过向现有几何基础模型(如 VGGT)添加额外的头来直接重建可遍历性信息(场景图的“位置”层)。我们的方法是任务驱动的,因为我们根据任务调整地图中对象和区域的粒度;例如,在操作任务期间,我们的方法能够解析炉子上的小旋钮,而在导航任务期间,它可以专注于大型物体(例如整个炉子)。然而,与相关工作的主要区别是,我们考虑了现实情况,其中任务列表不是预定义和固定的,而是随着机器人的操作而演变的。这自然允许处理复杂的局部操作任务,机器人可以随着任务的展开动态调整其表示。我们将由此产生的方法称为 FOUND-IT。 FOUND-IT 还包括一种代理方法来查询场景图中的信息。除了在 ASHiTA SG3D 任务任务定位基准测试中实现 79% 的更高准确度之外,我们还演示了 FOUND-IT 在使用 Jetson Thor 的地面机器人上实时运行。此外,为了强调我们方法的稳健性,我们演示了如何在 YouTube 上随意捕捉的房地产经纪人公寓之旅中构建 3D 场景图。代码将在发布后提供。