论文

UniAfford:用词元路由联合学习二维与三维可供性

UniAfford: Token-Routed Multitask Learning for Generalizable 2D-3D Affordance Perception

应用与实践视觉感知与空间理解

摘要

可供性感知旨在本地化支持具体交互的可操作区域,但 2D 和 3D 可供性基础已经发展成为单独的问题,具有不同的任务定义、监督格式、数据集和评估协议。这种碎片化限制了跨视觉和几何空间可转移的对象可供性语义的学习。我们提出了 Token Router for Tasks,这是一种基于 MLLM 的系统的多任务训练范例,它将上下文隐藏状态路由到特定于任务的分支,而不需要语言头生成预定义的标记。路由状态由特定于分支的目标直接监督,从而使密集的预测损失能够形成共享的 MLLM 表示。我们将这种范式实例化为 UniAfford,这是一个用于泛化 2D-3D 可供性感知的统一框架,以及 UniAfford-Data,这是一个在共享对象可供性分类下集成像素级 2D 注释、点级 3D 注释和语言指令的数据集,通过语义级 2D-3D 配对支持异构监督。 UniAfford 采用 MLLM 作为共享语义中心和模态感知词元路由器来生成图像和点云可供性查询。这些查询分别调节 SAM 式像素解码器和基于 SONATA 的点解码器,从而从仅图像、仅点云或配对多模态输入实现灵活的 2D、3D 和联合可供性推理。实验证明了跨 2D 和 3D 可供性基准的强大零样本泛化,无需针对特定目标进行微调,以及模态隔离协议下最先进的分支性能。消融验证词元路由、联合 2D-3D 监督和解码器耦合,而语言头诊断表明路由的潜在状态携带有意义的对象可供性语义。项目页面:https://4dvlab.github.io/UniAfford