论文
具身行动条件世界模型的因果去偏潜在行动模型
Causally Debiased Latent Action Model for Embodied Action-Conditioned World Models
摘要
行动条件世界模型(ACWM)旨在模拟以具体行动为条件的未来观察。然而,学习可控 ACWM 需要大规模的动作标记数据,而收集这些数据的成本仍然很高。潜在动作模型 (LAM) 通过从没有可执行动作标签的视频中推断潜在动作来缓解这一瓶颈,但现有的 LAM 通常仅使用重建目标进行训练,因此将与动作相关的动态与与动作无关的视觉混杂因素纠缠在一起。出于这样的目标,LAM 更倾向于视觉环境而不是动作动态,因此下游 ACWM 在零动作下表现出残余运动,并且无法再现提供的动态。我们提出 CD-LAM,这是一种基于 LAM 的 ACWM 的因果去偏框架。 CD-LAM 引入了三个去偏差目标:以具体化为中心的重建、以行动为中心的对比学习和潜在空间校准,它们共同鼓励以具体化为中心、行动感知和校准良好的表示。当以潜在动作和机器人动作为条件时,CD-LAM 可将动作跟随错误减少高达 42% 和 35%,同时提高保真度,并与 DreamDojo 参考相匹配,并减少超过 12$\times$ 的适应更新。 CD-LAM 还仅使用 DreamDojo-14B 样本曝光量的 3.2% 将 LTX-2.3-22B 改编为具有竞争质量的 ACWM。在 X-VLA 上,使用 CD-LAM 代替基线 LAM 进行预训练,可将 LIBERO、LIBERO-Plus 和 RoboTwin C2R 的成功率持续提高高达 5%。