论文

SLIM-0.5B:学习机器人操作的基于行动的预测潜伏

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

模型优化小模型/轻量模型

摘要

视觉-语言-动作策略依赖于大型多模式主干网络,在每个控制步骤中共同执行感知、语言调节和动作生成。这种能力大部分支持开放域语义,而连续的机器人操作主要需要观察、动作以及动作引起的转换的紧凑表示。像素级世界模型提供了另一种途径,但预测与控制无关的视觉细节可能会不必要地昂贵。我们提出了 SLIM(自监督潜在交互模型),一种紧凑的 0.5B 参数潜在交互策略。 SLIM 学习基于动作的预测潜伏,捕获以动作为条件的未来转变以及解释观察到的变化的动作。 SLIM 通过自我监督的屏蔽轨迹预测来学习这些表示,将动作重建与未来潜在预测相结合。紧凑的 Mixture-of-Transformer (MoT) 主干模型对观察潜伏和动作标记之间的交互进行建模。生成的策略通过流匹配进行训练,以生成语言条件动作。在模拟基准和现实世界评估中,SLIM 匹配或超过了代表性的大规模 VLA 和世界动作模型基线,参数更少,无需额外的具体预训练,推理延迟更低,并且 GPU 内存使用量大幅降低。