论文

AFUN:迈向功能理解的可供性基础模型

AFUN: Towards an Affordance Foundation Model for Functionality Understanding

模型训练预训练

摘要

可供性理解连接了视觉感知和身体动作,作为开放和非结构化现实环境中机器人操作的可解释界面。然而,建立一个可供性基础模型,不仅了解交互应该在哪里以及如何发生,而且能够在不同的环境、对象和任务中进行概括,仍然是一个长期存在的研究挑战。现有方法通常仅解决这一挑战的一部分,要么在不指定可执行运动的情况下定位与任务相关的区域,要么预测运动但可扩展性有限。在本文中,我们提出了我们的模型,这是迈向功能理解的可供性基础模型的一步。根据单个 RGB-D 观察和语言任务描述,我们的模型可以预测任务条件功能掩模(在哪里交互)和 3D 接触后运动曲线(如何交互)。为了支持开放世界的泛化,我们构建了一个大规模标准化数据管道,将异构机器人、人类、模拟和现实世界扫描数据转换为具有语言、掩模和以对象为中心的 3D 运动标签的共享可供性模式。我们从三个方面评估我们的模型:对于可供性分割,我们的模型在 4 个基准的 8 个测试集上大幅优于所有基线,将平均 gIoU/cIoU 提高了 +23.9/+26.3;对于接触点预测,它预测的点要准确得多,与最佳基线相比,命中率提高了 12.7--61.3%;对于 3D 运动,它在所有三个测试集上都实现了最佳性能。我们的模型可以部署用于现实世界的机器人操作,无需对机器人实施例进行微调或使用特定于任务的启发式方法,展示了适应开放世界可供性任务的能力。项目页面:https://www.zhaoningwang.com/AFUN