论文

LACE:跨实体学习的潜在视觉表示

LACE: Latent Visual Representation for Cross-Embodiment Learning

摘要

人类和机器人实施例之间的视觉差距阻碍了人类演示的跨实施例学习。虽然自监督学习(SSL)主干编码了一般对象的丰富的类间语义,但我们表明它们无法在人类和机器人手之间建立对应关系。我们提出了 LACE,这是一个框架,通过利用跨实施例共享身体部位之间的对应关系作为稀疏监督,在这些主干的潜在空间中对齐人类和机器人的视觉表示。这些注释可以通过正向运动学自动获得,并且单个机器人演示足以训练模型。我们的语义对齐损失与相应特征产生的分布相匹配,将补丁级监督提升到语义级对齐,而 Gram 损失则保留了预训练的特征质量。这种一致性使机器人策略能够在机器人演示稀缺时利用丰富的人类数据:在零样本传输中,使用 LACE-DINO 的策略大幅优于使用 DINO 的策略 (65\%),并且在低数据状态和分布外环境中具有一致的增益。