论文

LM-X:可解释的视觉-语言-通过进度、事件和不确定性预测进行动作建模

LM-X: Explainable Vision--Language--Action Modeling via Progress, Event, and Uncertainty Prediction

模型训练预训练

摘要

大规模视觉-语言-动作(VLA)策略具有先进的通用机器人控制,但大多数仍然是刺激到动作的黑匣子:动作被暴露,但它们的解释状态却没有。它们没有提供三个解释信号的本地说明:任务进度、下一个语义转换或本地命令可靠性。先前的工作表明,进展和事件结构有助于长期控制,而不确定性则支持监控;然而,此类功能通常仅在动作预训练之后添加或提取。因此,该领域缺乏解释状态与控制联合预训练的 VLA 基础模型。借鉴生物感觉运动组织,其中结果敏感、事件分段和概率预测结构行为,我们引入了 LM-X。 LM-X 学习三个直接监督的在线信号:返回运行 (RTG) 估计可见进度和状态质量; event-to-go (ETG) 预测下一个语义事件的动作序列;异方差动作流方差报告本地命令的可靠性。 RTG条件ETG和两者条件动作生成;不确定性是在行动专家内部估计的,使解释成为控制的一部分,而不是事后描述。我们对 LM-X 进行了超过 20,000 小时的异构真实机器人轨迹预训练,其中包括超过 1,000 小时的失败执行轨迹。受控门有利于联合训练而不是事后训练。 LM-X 在 50 个随机硬 RoboTwin2.0 任务上取得了 74.1\% 的成功率,在 7 个真实机器人任务上取得了 73.5\% 的成功率,而 GR00T N1.7 的成功率为 55.4\% 和 50.7\%。其信号跟踪进展和回归,预测事件规模的运动,检测高错误动作,并提供预先故障警告。这些结果将 LM-X 确立为可解释的 VLA 基础模型,将透明的预测状态与更强的通才控制结合起来。