论文
ABot-M0.5:统一的移动和操纵世界行动模型
ABot-M0.5: Unified Mobility-and-Manipulation World Action Model
摘要
移动操纵是通用机器人的一项关键能力,但对于当前的具体学习方法来说仍然具有挑战性。 VLA 策略通常是反应性的,缺乏明确的世界建模,而现有的世界动作模型 (WAM) 仍然与移动操纵的结构不太一致:它们对粗糙的视频块进行操作,对纠缠的导航操纵动作进行建模,并在与自回归推理不匹配的监督下训练逆动态。因此,他们经常错过细粒度的接触动态,遭受行动分配冲突,并在长程执行轨迹中积累错误。我们提出了 ABot-M0.5,这是一种新的 WAM,它建立在移动操作需要在三个级别上对齐的洞察之上:时间粒度、动作空间和训练测试一致性。为了调整时间粒度,我们引入了中间潜在动作,这些动作捕获局部视觉状态转换并充当视频潜在和特定于实施例的控件之间的桥接动作空间。为了对齐动作空间,我们设计了一个双层 Mixture-of-Transformer 架构,该架构可以解开模态表示和异构动作子空间(例如基础运动和手臂操作)。为了调整推理条件,我们提出了梦想强迫训练策略,该策略在模型预测视频上逐步训练逆动态,从而提高自回归预测期间的训练测试对齐和鲁棒性。在具有挑战性的移动和细粒度操纵基准上进行的实验表明,ABot-M0.5 在长期任务成功和细粒度控制精度方面都实现了最先进的性能。这些结果凸显了粒度对齐、动作解开和推理一致的世界动作建模的至关重要性。