论文

DriveMA:重新思考通过一步元操作驱动 VLA 的语言接口

DriveMA: Rethinking Language Interfaces in Driving VLAs with One-Step Meta-Actions

模型推理推理策略与问题分解

摘要

驱动视觉-语言-动作模型(Driving VLA)通常引入自然语言推理作为端到端规划的中间接口,但以推理为中心的接口面临三个实际瓶颈:获得高质量的推理注释很困难,生成和理解长推理链对于紧凑模型来说具有挑战性,并且推理延迟大幅增加。在本文中,我们重新思考了驱动 VLA 中的语言界面设计,并表明简洁的一步元操作是冗长推理的一种简单而有效的替代方案。元动作提供语义决策基础,同时保持低熵,并可自动从专家轨迹导出,从而实现可扩展的监督和可靠的轨迹调节。在此接口的基础上,我们提出了 DriveMA,它将以动作为中心的监督训练与回合级贡献分配强化学习框架相结合,共同优化元动作的正确性、轨迹质量和轨迹-元动作的一致性。实验表明,DriveMA 的 2B 模型已经在 Waymo 端到端驾驶挑战赛上达到了新的 state of the art,达到了 8.060 的评分者反馈分数 (RFS),而其 4B 版本进一步将 state of the art 提高到 8.079; DriveMA还在NAVSIM上获得了具有竞争力的性能。消融表明,与自然语言推理或更细粒度的动作序列相比,一步元动作在表达性、可预测性和推理效率之间提供了更好的实际权衡。代码、数据和模型将被发布以方便未来的研究。