论文
HARP-VLA:视觉-语言-动作模型的人机对齐表示学习
HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model
摘要
从大规模人类视频中学习可推广的视觉-语言-动作(VLA)模型是有前途的,但由于视觉观察和可执行动作的跨实施例差异而具有挑战性。虽然潜在动作模型通过学习动作抽象来减少动作执行差距,但它们仍然依赖于视觉特征。因此,人类和机器人视觉表示不一致可能会导致策略输入不一致,并引发依赖于领域的潜在动作,从而阻碍与人类视频的有效联合训练。为了解决这个问题,我们提出了 HARP,一种人机对齐的表示学习框架,用于从人类视频中进行更有效的 VLA 预训练。具体来说,HARP 使用有限的配对人类机器人演示作为跨实体桥梁,并使用大量不配对的人类和机器人视频作为可扩展的动态监督数据源。它训练了一个适应机器人的视觉编码器和一个潜在动作模型,该模型具有以操作为中心的辅助线索和源相关的配对辨别对齐损失,使机器人表示适应人类语义,同时保留配对级别的辨别力。学习到的对齐视觉编码器和潜在动作模型为 VLA 式策略学习提供了统一的视觉和动作表示,其中人类和机器人视频提供视觉语言到潜在动作的监督,轻量级机器人动作头将潜在动作转化为可执行命令。特征可视化、模拟和现实世界操纵的实验表明,人机对齐和下游策略性能得到了改善,在 CALVIN ABC$\rightarrow$D 上实现了 4.481 的平均长度,并且现实世界的成功率比最强基线提高了 7.1\%。