论文
以逆运动学强化驾驶 VLA 的视觉依据关联
Grounding Driving VLA via Inverse Kinematics
摘要
现有的驾驶 VLA 在预测轨迹的同时很大程度上忽略了它们的视觉标记——我们将这种现象归因于训练不足,而是结构上不恰当的任务制定。我们表明,从逆运动学的角度来看,轨迹恢复需要当前和未来的视觉状态作为边界条件;现有的 VLA 仅提供前者,这鼓励模型仅通过自我状态和文本命令走捷径。为了解决这个问题,我们以逆运动学求解器的方式重新设计了 Driving VLA。首先,下一个视觉状态预测目标需要 LLM 来预测未来的视觉场景,提供密集的视觉监督并抑制捷径。其次,一个单独的逆运动学网络(基于交叉注意的条件扩散模型)仅将当前和未来的视觉状态作为输入,旨在抑制轨迹解码期间对自我状态和文本快捷方式的依赖。仅凭这个简单的规定,我们的 0.5B 尺度模型就可以恢复视觉基础,并在闭环 NAVSIM-v2 和 nuScenes 基准测试中达到与 7B--8B VLA 相当的轨迹规划性能,其性能要大一个数量级以上。广泛的分析进一步表明,这种改进源于利用视觉特征的能力的恢复,其效果在转弯等动态驾驶情况下最为明显。