论文

ICR-Drive:端到端语言驱动自动驾驶的指令反事实鲁棒性

ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving

模型评测鲁棒性、公平性与可信度评测

摘要

视觉-语言-动作(VLA)模型的最新进展使语言调节的驾驶代理能够在闭环模拟中执行自然语言导航命令,但标准评估很大程度上假设指令是精确且格式良好的。在部署中,指令的措辞和特异性各不相同,可能会省略关键限定符,并且有时可能包含误导性的、权威框架的文本,从而导致指令级别的稳健性无法得到充分衡量。我们推出了 ICR-Drive,这是一种用于端到端语言条件自动驾驶中指令反事实稳健性的诊断框架。 ICR-Drive 生成​​涵盖四个扰动系列的受控指令变体:释义、歧义、噪声和误导,其中误导性变体与导航目标相冲突并试图覆盖意图。我们在匹配的模拟器配置和种子下重播相同的 CARLA 路线,以隔离由于指令语言引起的性能变化。使用标准 CARLA 排行榜指标和相对于基准指令的每个系列的性能下降来量化稳健性。 LMDrive 和 BEVDriver 上的实验表明,微小的指令变化可能会导致性能大幅下降和明显的故障模式,揭示了在安全关键型驾驶中部署具体基础模型的可靠性差距。