论文

UniFunc3D:3D 功能分割的统一主动时空基础

UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation

模型推理推理策略与问题分解

摘要

3D 场景中的功能分割需要代理将隐式自然语言指令转化为细粒度交互元素的精确掩码。现有的方法依赖于碎片化的管道,这些管道在初始任务解析过程中会出现视觉失明的情况。我们观察到这些方法受到单尺度、被动和启发式框架选择的限制。我们提出了 UniFunc3D,一个统一的 无需训练 框架,它将多模态 大语言模型 视为主动观察者。通过将语义、时间和空间推理合并到单个前向传递中,UniFunc3D 对直接视觉证据中的地面任务分解执行联合推理。我们的方法引入了具有从粗到细策略的主动时空基础。这使得模型能够自适应地选择正确的视频帧并专注于高细节的交互部分,同时保留消歧所需的全局上下文。在 SceneFun3D 上,UniFunc3D 实现了最先进的性能,大幅超越了 无需训练 和基于训练的方法,相对提高了 59.9\% mIoU,且无需任何特定于任务的训练。代码将发布在我们的项目页面:https://jiaying.link/unifunc3d。