论文
驾驶视觉-语言-动作模型中规划词元的深度探索和修剪
Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model
摘要
视觉-语言-动作 (VLA) 模型通过深度语言模型路由驾驶决策,但尚不清楚动作本身需要多少深度。我们研究了一个代表性的驾驶 VLA,其整个计划由单个规划词元承载,生成规划器将其解码为轨迹。借用规划器作为轨迹空间 logits 透镜,我们对 32 个解码器层中每一层的规划词元进行解码,并测量两个信号:导航命令的线性可解码性以及与冻结的本机规划器的轨迹兼容性。我们的诊断表明,语义意图可以在早期进行线性解码:在第一个解码器层之后,命令探测准确率达到 97.7%,而几率为 16.7%。相比之下,与冻结的本机规划器的兼容性在深度上逐渐提高,开环 Avg-L2 仅在最后一层达到最小值 2.11\,m。从第一层学到的读数弥补了这一差距的大部分,表明规划信息已经提前出现,但尚未以部署的规划器预期的格式表示。根据解码器层在规划词元中引起的角度偏差对解码器层进行排名,可以在相对开环误差增加约 5% 的情况下删除 32 层中的 8 层,并产生测量的 1.33$\times$ 解码器加速。在评估的样本量下,没有统计上解决了家族特定的退化问题。这些发现仅限于评估的 ORION 检查点和 Bench2Drive 设置。