论文

VoxAfford:用于开放词汇 3D 可供性检测的多尺度体素标记融合

VoxAfford: Multi-Scale Voxel-Token Fusion for Open-Vocabulary 3D Affordance Detection

应用与实践视觉感知与空间理解

摘要

开放词汇 3D 可供性检测需要在给定新颖的可供性描述的情况下本地化点云上的交互区域。最近的方法使用特殊的输出标记扩展了多模态 大语言模型 (MLLM),这些标记被解码为分段掩码。然而,这些标记是通过自回归生成生成的,它模拟顺序依赖关系而不是空间邻域关系,这使得它们在语义上丰富但在空间上缺乏 3D 定位。我们提出了体素增强功能可供性检测(VoxAfford),它通过将来自冻结的预训练 3D VQVAE 编码器的多尺度几何特征注入到生成后的输出标记中来绕过这个瓶颈。每个输出标记使用其可供性语义作为查询,通过交叉注意力从其配对的体素尺度中检索相关的几何图案,并通过学习的兼容性门控制注入强度。然后,增强的标记通过语义条件注意力聚合成空间感知的可供性提示,并与每点特征一起传播以生成最终的掩模。开放词汇可供性检测任务的实验表明,VoxAfford 实现了最先进的性能,mIoU 提高了约 8%,并且真实的机器人实验证实了向新物体的零样本迁移。