论文

NoRD:无需推理即可驾驶的数据高效视觉-语言-动作模型

NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning

模型训练强化学习RLVR

摘要

视觉-语言-动作(VLA)模型通过用统一的端到端架构取代模块化管道来推进自动驾驶。然而,当前的 VLA 面临两个昂贵的要求:(1)海量数据集收集,(2)密集推理注释。在这项工作中,我们用 \modelname 解决了这两个挑战(\textbf{No} \textbf{R}easoning for \textbf{D}riving)。与现有的 VLA 相比,\modelname 实现了具有竞争力的性能,同时对 $<$60\% 的数据进行了微调,并且没有推理注释,从而减少了 3$\times$ 的标记。我们发现,当标准组相对策略优化(GRPO)应用于在如此小的、无推理数据集上训练的策略时,无法产生显着的改进。我们表明,这种限制源于难度偏差,它不成比例地惩罚来自 GRPO 内产生高方差推出的场景的奖励信号。 \modelname 通过结合 Dr.~GRPO 克服了这个问题,Dr.~GRPO 是一种旨在减轻大语言模型难度偏差的最新算法。因此,\modelname 只需一小部分训练数据且无需推理开销,即可在 Waymo 和 NAVSIM 上实现具有竞争力的性能,从而实现更高效的自主系统。

NoRD:无需推理即可驾驶的数据高效视觉-语言-动作模型
图1:VLA 训练流水线的比较。(a) 现有方法依赖大规模推理数据生成,随后进行大量的 SFT 与 RL 微调。(b) 相比之下,NoRD 直接利用小规模驾驶数据集进行 SFT,并针对较弱的 SFT 策略执行 RL 微调,从而在无需推理监督的情况下实现数据高效的学习。