论文
生成基于视觉几何的多视图对抗示例 Transformer
Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer
摘要
Visual Geometry Grounded Transformer (VGGT) 支持从多视图图像进行统一前馈 3D 重建。然而,部署这样的高性能模型可能会暴露严重的安全漏洞。传统的对抗性扰动需要昂贵的每个场景优化,而通用对抗性扰动 (UAP) 依赖于单一静态模式,无法有效攻击 VGGT。为了解决这些限制,我们提出了 \textbf{MVAP-G},一种多视图对抗性扰动生成器,它可以在单个前馈传递中跨多个视图产生难以察觉的一致扰动。为了确保不同场景之间的扰动一致性,我们设计了一种跨视图对抗性对齐机制来处理多视图图像。实验表明,在推理过程中无需迭代优化,MVAP-G 会显着降低 VGGT 性能。这项工作开创了对 3D 基础模型的多视图对抗性攻击,发现了严重的漏洞,并强调了对强大的 3D 视觉系统的迫切需求。代码可在 https://github.com/qsong2001/mvap-g 获取。