论文

从像素到概念:利用基础模型发展丰富的 3D 语义场景图森林

From Pixels to Concepts: Growing Rich 3D Semantic Scene Graph Forests utilizing Foundation Models

上下文与知识知识图谱

摘要

在复杂的现实环境中运行需要机器人在功能语义层面上理解周围环境。这需要一个详细的多层世界模型来捕获周围环境的复杂关系。分层 3D 场景图通过在统一的空间框架内集成几何、语义和关系数据来解决这一挑战。然而,当前的 3D 场景图方法通常将自己限制在预定关系类的严格结构中,大多忽略了重要的语义连接,例如因果连接或环境上下文。本文探讨了基础模型构建具有开放语义关系的 3D 场景图森林的潜力,以改善场景理解和机器人任务执行。我们提出了一种方法,其中实例特定的概念节点和关系首先由 VLM 识别,并由 LLM 扩展,通过推理推断更广泛、更抽象的概念节点和关系。然后,这些对象节点、概念节点和关系被组装成分层 3D 场景图的森林,并通过概念节点进行增强以表示抽象概念。对 uHumans2 和 ScanNet 室内数据集进行了评估,验证了生成的关系的准确性和相关性。场景图森林对于机器人应用的下游适用性在利用 ScanNet 数据的开放词汇对象检索任务和使用 Boston Dynamics Spot 的真实室内部署中得到了证明。本文利用基础模型创建更具表现力、语义更深入的 3D 分层场景图,并展示了它们在推进机器人技术语义和环境理解方面的潜力。