论文

AffordAny:通过视觉语言引导的几何推理从单目 RGB 图像获得开放世界 3D 可供性基础

AffordAny: Open-World 3D Affordance Grounding from Monocular RGB Images via Vision-Language-Guided Geometric Reasoning

应用与实践视觉感知与空间理解

摘要

开放世界 3D 可供性基础需要在给定自由形式语言查询的情况下本地化 3D 中的功能对象部分。现有方法通常假设预先构建的以对象为中心的 3D 几何结构和封闭的可供性本体,限制了原始 RGB 观察的部署。我们提出了 AffordAny,这是一种端到端框架,它使用单目 RGB 图像来构建大规模文本条件 3D 零件监督、使用冻结视觉语言模型 (VLM) 引导解码器的地面可供性,并通过伪标签自训练提高开放世界泛化能力。我们的自动化管道生成了涵盖 473 个类别的 5,334 个对象和 10,633 个零件级样本的基准,与之前的工作相比,类别多样性增加了数量级。解码器通过空间投影、指令条件语义压缩和双向几何语义交互,逐步将冻结的 Cosmos-2B 特征与 3D 几何融合。最小扰动伪标签自我训练进一步添加了新对象,无需人工注释。在评估未见对象、未见类别和未见指令释义的系统泛化协议下,我们的方法在自我训练后在未见对象上实现了 0.428 IoU,在未见类别上实现了 0.315 IoU,未见类别 mIoU 相对提高了 6.3%(p<0.01),指令敏感性差距仅为 0.105,证明了我们方法的有效性和鲁棒性。