论文

提炼视觉语言模型以实现自动驾驶汽车中稳健的交通标志感知

Distilling Vision-Language Models for Robust Traffic Sign Perception in Autonomous Vehicles

摘要

基于深度神经网络的交通标志识别(TSR)模型实现了强大的清洁数据性能,但仍然容易受到物理上可实现的对抗性攻击,包括阴影扰动、自然光干扰和印刷补丁。现有的防御措施通常会提高针对一种攻击类型的鲁棒性,同时降低其他攻击类型的性能,并且会降低干净的准确性。我们提出了 LAMDA(方向对齐的语言锚定模型),这是一种训练框架,可将基于语言的结构转移到 TSR 模型中,而无需使用对抗性示例或增加推理时间开销。 LAMDA 使用冻结的 OpenCLIP 文本编码器根据 VLM 生成的符号描述和类名称构建两个固定原型库,并使用它们在训练期间通过两个互补的辅助损失来监督视觉特征。在推理时,适配器和原型库被丢弃,留下标准主干和分类器。在针对四种骨干网和三种物理攻击类型的 GTSRB 和 LISA 上进行评估后,LAMDA 是十种评估方法中唯一能够持续提高所有攻击-骨干-数据集组合的鲁棒性的方法,在阴影攻击下的增益高达 +12.5 pp,在自然光攻击下的增益高达 +13.2 pp,同时在几乎所有情况下保持或提高干净的准确性。