论文

AdvNav:对视觉语言导航的行为引导黑盒对抗性攻击

AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation

模型评测安全与风险评测

摘要

尽管嵌入式人工智能取得了进展,但视觉和语言导航系统仍然容易受到对抗性视觉干扰的影响。大多数现有方法依赖于对目标模型梯度的白盒访问,这对于实际部署的系统来说通常是不现实的,并且由于用于优化的递归反向传播而导致计算量巨大,从而限制了它们的适用性。虽然以前的黑盒方法主要针对单步瞬时决策任务,但它们很难处理任务复杂性和时间依赖性。这凸显了对无梯度攻击方法的需求,该方法可以仅使用可观察的输入和输出来有效地破坏多步顺序感知-动作循环。因此,我们提出了 AdvNav,一种行为引导的黑盒对抗攻击框架,可以在导航过程中干扰代理的第一人称视角。为了构建信息代理目标,以在黑盒设置下进行无梯度搜索的有效优化指导,我们设计了一种基于双粒度行为的反馈,聚合代表整体导航退化的轨迹级性能得分、考虑潜在决策风险的动作级奖励得分以及偏差指标,所有这些都从代理的自我输出行为中提取。这种反馈指导混合优化策略,通过自适应更新启发式地调整扰动强度,并从遗传上进化噪声空间结构,以迭代地发现最具破坏性的噪声配置。在 R2R 数据集上与基于 Transformer 的 HAMT 和基于 LLM 的 MapGPT(具有两种类型的骨干网)进行评估,AdvNav 实现了 49.70/65.96/87.30% 的攻击成功率。结果证明了 AdvNav 的有效性和通用性,揭示了关键的感知漏洞,并为未来弹性 VLN 模型的设计提供了见解。