MolmoAct2:现实世界部署的动作推理模型
MolmoAct2: Action Reasoning Models for Real-world Deployment
摘要
视觉-语言-动作 (VLA) 模型旨在为机器人提供单一的通用控制器,但当今的系统达不到现实世界部署的重要标准。前沿模型是封闭的,开放权重替代方案与昂贵的硬件绑定在一起,推理增强策略为其基础付出了令人望而却步的延迟,并且微调的成功率仍然低于可靠使用的阈值。我们推出了 MolmoAct2,这是一个专为实际部署而构建的完全开放的动作推理模型,沿着五个轴推进了其前身。我们引入了 MolmoER,这是一个专门用于空间和具体推理的 VLM 主干,在 330 万样本语料库上进行了专门训练,然后进行排练。我们发布了三个跨越中低成本平台的新数据集,包括 MolmoAct2-BimanualYAM、构成迄今为止最大的开放双手数据集的 720 小时遥控双手轨迹,以及经过质量过滤的 Franka (DROID) 和 SO100/101 子集。我们提供 OpenFAST,这是一种开放权重、开放数据的动作分词器,在五个实施例中对数百万条轨迹进行了训练。我们重新设计了架构,通过每层 KV 缓存调节将流匹配连续操作专家移植到离散词元 VLM 上。最后,我们提出了 MolmoThink,一种自适应深度推理变体,仅针对时间步之间变化的场景区域重新预测深度标记,以先前延迟的一小部分保留几何基础。在迄今为止对任何开放 VLA 进行的最广泛的实证研究中,涵盖 7 个模拟和现实世界基准,MolmoAct2 优于包括 Pi-05 在内的强大基准,而 MolmoER 在 13 个体现推理基准上超过了 GPT-5 和 Gemini Robotics ER-1.5。我们发布模型权重、训练代码和完整的训练数据。项目页面:https://allenai.org/blog/molmoact2