论文
MobileVLA-R1 2.0:用于移动机器人控制的强化学习推理
MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control
摘要
由于高级语义推理与低级运动和操纵控制之间持续存在差距,将自然语言指令转化为可靠且可执行的动作仍然是移动机器人视觉语言动作(VLA)系统的基本挑战。现有方法通常依赖于隐式推理或整体动作预测,因此很难在产生精确且适应性强的机器人动作的同时保持连贯的长期决策。为了应对这一挑战,我们提出了 MobileVLA-R1 2.0,这是一种 RL 增强的 VLA 框架,它将结构化的具体推理与可执行的移动机器人控制明确结合起来。该框架通过有监督的思想链(CoT)对齐和强化学习来学习具体轨迹的多粒度推理,从而超越纯粹的行为监督,提高推理到行动的一致性。为了支持运动和操纵,我们进一步引入了一种推理条件动作解码器,它将多模态推理表示映射到任务级动作目标,随后由机器人控制器将其转换为特定于实施例的命令。该设计提供了统一的感知-推理-动作接口,同时将高级动作生成与机器人特定的驱动解耦。我们对语言引导导航、四足控制和人形移动操纵进行了广泛的评估,涵盖 VLN-CE、QUARD 以及 Unitree Go2 和 G1 机器人上的实际部署。 MobileVLA-R1 2.0 始终优于强大的 VLA 基线,与 MobileVLA-R1 相比,VLN-CE 上的 SR 平均提高了 1.6 点,现实世界 G1 移动操作任务的全任务成功率比 MobileVLA-R1 提高了 10.0 点,同时在不同机器人平台上展示了强大的长视野指令跟踪和闭环执行能力。