论文
以运动为中心的潜在动作支持人类 EgoVideos 的跨实施例 VLA 训练
Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos
摘要
训练多面手视觉-语言-动作 (VLA) 模型通常需要大量、多样化的机器人数据集和高保真动作注释。虽然以自我为中心的人类操纵视频非常丰富,并且捕捉到了显着的环境多样性,但缺乏动作标签使得它们难以在传统的训练范例中使用。为了解决这个问题,我们提出了一种基于潜在动作的框架,旨在从未标记的人类视频中提取一般动作先验。该架构采用混合解缠 VQ-VAE,通过物理掩模将运动动力学与环境背景解耦,从而能够构建跨实体的动作密码本。通过使用代码本在人类视频上进行 预训练,VLM 主干学习了动作意图的深度表示。为了适应特定的实施例,我们引入了意图感知解耦策略,其中VLM预测动作意图,而单独的冻结视觉编码器向动作专家提供状态特定的特征,从而减少动作幻觉。模拟和现实环境中的结果表明,我们的方法专门针对未标记的人类视频进行了预训练,其性能与在大量注释数据集上训练的最先进的 VLA 模型具有竞争力,仅需要 50 个轨迹进行下游适应。