论文

T-FunS3D:任务驱动的分层开放词汇 3D 功能分割

T-FunS3D: Task-Driven Hierarchical Open-Vocabulary 3D Functionality Segmentation

应用与实践视觉感知与空间理解

摘要

开放词汇 3D 功能分割使机器人能够在 3D 场景中定位功能对象组件。这是一项具有挑战性的任务,需要空间理解和任务解释。当前的开放词汇3D分割方法主要关注对象级识别,而场景范围的部分分割方法试图详尽地分割整个场景,这使得它们高度资源密集且耗时。在粒度、准确性和速度方面平衡分割性能仍然是一个挑战。作为缓解这一问题的一个步骤,我们引入了 T-FunS3D,这是一种任务驱动的分层开放词汇 3D 功能分割方法,可为机器人应用程序提供可操作的感知。我们的方法将 3D 点云和室内场景的 RGB-D 图像作为输入。我们通过提取实例及其在环境中的视觉嵌入来构建开放词汇场景图。给定任务描述,T-FunS3D 识别场景图中最相关的实例,并利用视觉语言模型定位其功能组件。 SceneFun3D 数据集上的实验表明,T-FunS3D 在开放词汇 3D 功能分割方面可与最先进的技术相媲美,同时实现更快的运行时间并减少内存使用。