论文
机器人策略学习的几何动作模型
Geometric Action Model for Robot Policy Learning
摘要
通用机器人策略必须遵循用户指令,同时推理对象、摄像机和机器人动作如何在 3D 物理世界中交互。最近的视觉语言动作模型(VLA)和视频世界动作模型(WAM)从大规模基础模型继承了强大的语义或时间先验,但它们仍然主要在 2D 图像帧或 2D 衍生的潜在空间上运行,隐式地留下了丰富接触操作所需的 3D 几何形状。我们提出了几何动作模型(GAM),这是一种语言条件操纵策略,它直接将预训练的几何基础模型(GFM)重新用作感知、时间预测和动作解码的共享基础。 GAM 在中间层分割 GFM:浅层充当观察编码器,在分割层插入因果未来预测器,预测以语言、本体感觉和动作历史为条件的未来潜在标记。然后,预测的未来词元将通过剩余的 GFM 块进行路由,以进行特征传播和解码,从而允许单个主干网生成未来的几何图形和动作。该设计通过最小的架构修改为 GFM 配备了语言条件的时间世界建模,同时保留了其丰富的几何先验。在一系列广泛的模拟和真实机器人操作基准中,GAM 比当前的基础模型规模基准更准确、更稳健、更快、更轻。