论文

验证而不是采样:视觉语言和视觉语言动作模型的区域级鲁棒性

Validating, Not Sampling: Region-Level Robustness of Vision-Language and Vision-Language-Action Models

模型评测评测方法与指标

摘要

视觉语言模型(VLM)和视觉语言动作模型(VLA)越来越多地部署在现实世界的应用中。在那里,对记录的摄像机图像的微小干扰可能会显着改变决策。然而,这些模型的现有基准仅采样扰动,这并不能保证未经测试的区域不存在故障。我们首次对六个 VLM(来自 Gemma、InternVL、LLaVA 和 Qwen 系列)和五个 VLA(来自 GR00T、OpenVLA 和 $\pi$ 系列)在光度和几何图像扰动的整个连续区域上进行了鲁棒性验证:亮度变化、相机旋转及其组成。为此,我们建立在验证框架 H$^2$V 的基础上,并引入 H$^2$V-M,这是一种边缘感知收敛规则,使验证在 32B 参数规模下变得可行。我们证明 H$^2$V-M 在模型查询中比 H$^2$V 好一个数量级,并且它比随机采样更快地找到反例,同时提供健全性保证。我们的 VLM 和 VLA 鲁棒性验证表明,鲁棒性主要取决于扰动类型,而不是模型,并且 VLM 对大相机旋转比 VLA 更鲁棒。对于 VLA,在许多情况下,即使是小到 $\pm1^\circ$ 的扰动也可以改变命令的操作。我们还表明,鲁棒性更多地取决于模型系列而不是模型大小。