论文

A4A:来自人类演示的面向行动的 4D 可供性的跨实施例转移

A4A: Cross-Embodiment Transfer of Action-Oriented 4D Affordances from Human Demonstrations

模型训练预训练

摘要

人类演示包含丰富的操纵知识,但目前尚不清楚哪些信息可以有效地转移到机器人控制中。现有的可供性表示通常被制定为 2D 掩模、3D 区域、接触点或可操作性分数,因此主要确定交互可能发生的位置。然而,有效的操作还需要对任务执行过程中交互相关的几何形状如何演变进行建模。为了弥补这一差距,我们引入了面向行动的 4D 可供性,它代表了交互相关 3D 点的语言条件未来轨迹。这些轨迹捕获任务条件的几何演化,而不是特定于实施例的动作,从而实现人类和机器人之间可转移的交互先验。基于这种表示,我们从现有的人与物体交互视频数据和互补的 RGB-D 演示中构建了一个大规模的面向动作的 4D 可供性数据集,并引入了 A4A,这是一种可供性到动作框架,它使用 4D 可供性轨迹预测在操作 微调 之前预训练机器人策略。模拟和现实世界中的实验验证了 A4A 的有效性,表明使用面向行动的 4D 可供性数据进行预训练可以持续提高各种 VLA 策略的操纵性能。这些结果将面向行动的 4D 可供性建立为有效的跨实施例表示,用于将操作知识从人类演示转移到机器人控制。