论文
ACG-WAM:动作条件几何预测辅助世界动作模型训练
ACG-WAM: World-Action Modeling via Action-Conditioned Geometric Latent Prediction
摘要
世界动作模型联合学习视觉预测和机器人动作,为策略学习提供了一种使用场景演化观察的方法。然而,他们的视频和动作损失没有为演示的动作序列的几何后果提供明确的目标。此外,在时间注意力之后采取的视觉特征可能包含未来的观察结果,使得它们不适合作为辅助预测器的唯一当前视觉输入。我们介绍了 ACG-WAM 及其辅助目标,即动作条件几何联合嵌入预测架构(ACG-JEPA),它使用每个当前和未来图像对的冻结 VGGT 编码的未来槽作为目标,从当前观察和干预动作中预测多个视野中的几何特征。我们将头部和手腕摄像头的这种监督应用于时间混合之前的共享视觉嵌入,并在推理时删除 教师模型 和辅助模块。在 50 个 RoboTwin 2.0 任务中,ACG-WAM 在干净场景中取得了 93.46% 的成功,在比较方法中,随机成功率 (92.68%) 和两种设置的平均值 (93.07%) 最好;在真实机器人上完成三项任务时,它取得了 85.00% 的成功率和 91.67% 的部分完成率,分别比 Motus 高出 10.00 个和 9.17 个百分点。代码:https://github.com/RoboOpus/ACG-WAM.Website:https://RoboOpus.github.io/ACG-WAM.
