论文
TPS-Drive:基于 VLM 的自动驾驶的任务引导表示纯化
TPS-Drive: Task-Guided Representation Purification for VLM-based Autonomous Driving
摘要
视觉语言模型 (VLM) 为自动驾驶规划提供了有希望的基础,但连接语义推理和精确的 3D 空间预测仍然是一个关键挑战。现有的表示策略一般遵循两条路径:文本对齐方法将连续的空间状态扁平化为符号,这会损害几何结构并诱发“空间幻觉”;密集的视觉方法保留了空间拓扑,但用冗余的背景纹理压倒了标准标记器,导致“表示干扰”。为了解决这些限制,我们引入了 TPS-Drive,这是一种以任务引导表示纯化为中心的新颖框架,使 VLM 能够在纯化空间中进行思考。其核心是,以代理为中心的分词器利用由冻结 3D 检测头监督的任务引导矢量量化机制,该机制将有限的码本容量从普遍的静态背景显式地重新分配给关键的动态代理,并有效地隔离空间冗余。利用这种纯化的空间词汇,TPS-Drive 采用解耦推理管道,依次执行场景理解、未来预测和动作生成。该框架通过渐进的三阶段训练范例进行优化,最终实现超越纯粹模仿学习的奖励驱动的细化。大量实验验证了我们的方法:TPS-Drive 实现了准确的代理空间状态预测,并降低了开环 nuScenes 评估中的碰撞率,同时在严格的闭环 NAVSIMv1 和 NAVSIMv2 基准上建立了新的安全记录。