论文

MindVLA-U1:VLA 在自动驾驶领域凭借统一流媒体架构击败 VA

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

应用与实践行业应用

摘要

自动驾驶已经从模块化管道发展到端到端统一,而视觉-语言-行动(VLA)模型是这一旅程超越视觉到行动(VA)的自然延伸。在实践中,驱动 VLA 在规划质量上常常落后于 VA,这表明困难不仅仅是模型规模,而是语义推理、时间上下文和连续控制相结合的接口。我们认为,这种差距反映了 VLA 的构建方式(作为孤立的子任务改进,无法构成连贯的驱动能力),而不是 VLA 是什么。我们推出 MindVLA-U1,这是第一个用于自动驾驶的统一流式 VLA 架构。统一的 VLM 主干在一个共享表示上的单次前向传递中生成 AR 语言标记(可选)和流匹配连续动作轨迹,从而保留每种模态的自然输出形式。完整的流式设计按帧处理驱动视频,而不是在昂贵的时间 VLM 建模下作为固定视频动作块。计划的轨迹在帧间平滑地演变,而学习的流内存通道则承载时间上下文和更新。统一的架构通过灵活的自注意力上下文管理,在密集和稀疏的 MoT 主干上实现快/慢系统,并公开了可测量的语言控制路径:语言预测的驱动意图通过无分类器指导(CFG)引导动作扩散,将语言侧意图转化为控制信号以进行连续的行动规划。在长尾 WOD-E2E 基准上,MindVLA-U1 通过 2 个扩散步骤首次超越了经验丰富的人类驾驶员(8.20 RFS 与 8.13 GT RFS),大幅超越之前的 VA/VLA 实现了最先进的规划 ADE,并匹配 VA 延迟(16 FPS 与 RAP 在 1B 规模下的 18 FPS),同时保留了人车交互的自然语言界面。