论文
VLAff:统一可操作功能可供性的视觉语言功能可供性模型
VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances
摘要
从人类视频中学习操作技能对于可扩展的机器人学习来说是有希望的。然而,人类和机器人之间的体现不匹配使得这具有挑战性。一种有前途的解决方案是学习与具体实施无关的以对象为中心的可操作的可供性。在这项工作中,我们提出了一个框架,利用以自我为中心的人类视频以及最先进的 3D 运动结构和手网格重建来提取可操作的可供性,例如视觉、抓握和轨迹可供性,这些可供性明确地编码在哪里交互、如何抓取以及如何移动。我们构建了 EgoAffordance,这是一个包含 204K 个片段的大型数据集,其中包含 560 万个视觉可供性和 1160 万个抓取和轨迹可供性。在此基础上,我们引入了 VLAff,这是一种基于大型视觉语言模型的统一基础模型,可以学习所有可操作功能的跨模式相关性。根据视觉观察和指令,VLAff 会生成视觉可供性热图、抓取姿势和轨迹,然后利用 3D 场景信息将其转换为直接可执行的动作。通过大量的实验,我们证明 VLAff 不仅在视觉可供性预测方面实现了最先进的性能,而且还可以有效地应用于真实的机器人应用,例如零样本操作和可供性引导的机器人学习。