论文

视觉-语言-动作驾驶的因果场景叙述与运行时安全监督

Causal Scene Narration with Runtime Safety Supervision for Vision-Language-Action Driving

上下文与知识上下文工程

摘要

自动驾驶的视觉-语言-动作(VLA)模型必须集成不同的文本输入,包括导航命令、危险警告和交通状态描述,但当前的系统通常将这些输入呈现为断开连接的片段,迫使模型自行发现哪些环境约束与当前的操作相关。我们引入因果场景叙述 (CSN),它通过意图约束对齐、定量基础和结构化分离在推理时以零 GPU 成本重组 VLA 文本输入。我们通过基于 Simplex 的运行时安全监督和通过具有负对数似然 (NLL) 正则化的 Plackett-Luce DPO 进行训练时间对齐来补充 CSN。多城镇闭环 CARLA 评估显示,CSN 在原始 LMDrive 的基础上将驾驶分数提高了 31.1%,在偏好一致的变体上提高了 24.5%。受控消融表明,因果结构占这一增益的 39.1%,其余部分仅归因于信息内容。感知噪声消融证实 CSN 的优势对于实际传感误差具有鲁棒性。语义安全监督可以提高违规分数,而反应性碰撞时间监控会降低性能,这表明 VLA 系统需要意图感知监控。