论文
潜在质心转向:用于命令对齐自动驾驶的单通道无分类器指导
Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving
摘要
视觉语言模型(VLM)最近已成为端到端自动驾驶的一种有前途的范例,使代理能够将多模式输入和高级导航指令直接映射到可执行轨迹。然而,在实践中,这些模型表现出持续的命令跟随差距:预测轨迹通常对导航命令表现出较弱的敏感性,导致在关键决策点出现不正确的行为。我们将这个问题视为条件策略崩溃的一种形式,其中多模态轨迹分布下基于回归的训练鼓励模型依赖主导视觉先验,同时边缘化语言条件信号。为了解决这个问题,我们引入了一种用于基于回归的视觉语言驱动的无分类器指导(CFG)的原则性表述。我们表明,CFG 可以解释为通过对比条件和无条件预测来隔离动作空间中指令引起的残差,从而显式放大导航命令在推理时的效果。然而,标准的两遍 CFG 为实时控制带来了令人望而却步的延迟,并产生嘈杂的实例级指导方向。基于 CFG 的均值漂移解释,我们提出了潜在质心引导(LCS),这是一种单遍引导机制,用类级潜在漂移取代实例级残差。通过将条件表示投影到预先计算的特定于命令的质心,LCS 基于集群几何形状执行类级潜在转向,这既更稳定又计算效率更高。我们证明,LCS 将推理延迟减少了约 50%,同时在闭环 (Bench2Drive) 和开环 (nuScenes) 基准测试中实现了更强的命令依从性和改进的驾驶性能。代码可在 https://github.com/codingmlinprocess/LCS 获取。