论文

针对端到端自动驾驶的难以察觉的攻击的对抗性流匹配

Adversarial Flow Matching for Imperceptible Attacks on End-to-End Autonomous Driving

模型评测安全与风险评测

摘要

自动驾驶(AD)正在通过两个主要范式向端到端(E2E)框架发展:以视觉-语言-动作(VLA)为代表的整体模型和专门的模块化架构。尽管设计不同,但这两种范式越来越依赖 Transformer 主干进行复杂推理,这可能会导致一个共同的漏洞:视觉上难以察觉的扰动可以通过针对 Transformer 模块来操纵 E2E AD 模型进行危险操作。大多数现有的针对 AD 系统的对抗性攻击方法都是在白盒或黑盒设置下运行的;然而,它们通常需要完全的模型透明度,或者遭受令人望而却步的查询延迟或有限的攻击可转移性。在本文中,我们提出了对抗流匹配(AFM),这是一种新颖的灰盒攻击框架,利用 E2E AD 模型中的 Transformer 结构漏洞。 AFM 通过神经平均速度场能够高效地一步生成对抗性示例。此外,所提出的技术通过协同扰动生成潜在空间和神经平均速度场,产生有效且视觉上难以察觉的攻击。大量实验表明,AFM 在攻击有效性和不可察觉性之间实现了卓越的权衡:与基线相比,它大大降低了 VLA 和模块化 AD 代理在各种场景中的性能,同时保持了最先进的视觉不可察觉性。此外,AFM 生成的对抗性示例表现出强大的跨模型可转移性,这表明 AFM 非常接近黑盒攻击设置,同时只需要目标 AD 模型包含基于 Transformer 的模块的先验知识。