论文
CVPR 2026@AdvML 研讨会挑战技术报告
Technical Report on the CVPR 2026@AdvML Workshop Challenge
摘要
视觉语言代理 (VLA) 越来越多地用于解释复杂的驾驶场景并支持安全关键推理。本报告介绍了针对自动驾驶 VLA 的对抗性多模式攻击的 CVPR 2026@AdvML 研讨会挑战。该挑战以 DriveLM 风格的多视图视觉问答为基础,用六个同步摄像机图像和驾驶相关问答对的结构化集合来代表每个场景。参与者生成对抗性图像和仅后缀的文本扰动,导致模型响应偏离参考答案,同时保持图像保真度并限制文本成本。竞赛分为两个阶段,第二阶段添加了一个隐藏的黑盒模型来评估可转移性。我们描述了任务设计、提交规则、评估协议和排行榜结果,然后检查了可获得技术报告的五个主要提交内容。在这些报告中,出现了几种反复出现的模式:后缀惩罚有利于图像端攻击;场景级、多视图优化比单独处理视图更有效; QA 类型和图结构为分配攻击预算提供了有用的先验;特征空间目标可以改善黑盒传输;摄像头图像中嵌入的印刷内容暴露了驱动 VLA 时的持续漏洞。这些发现为未来多模态自动驾驶系统的鲁棒性评估和防御设计提供了实用参考。