论文

视觉语言模型的语义鲁棒性认证

Semantic Robustness Certification for Vision-Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

视觉语言模型(VLM)现在广泛用于下游任务。然而,现实世界的应用程序经常使 VLM 面临由语义变化(例如形状、大小和样式)引起的分布变化。鲁棒性认证确定模型的预测在对其输入应用转换时是否会发生变化。虽然大多数认证框架研究输入的几何或像素级转换,但这项工作提出了一种新颖的框架,可以在语义级转换下验证 VLM 的鲁棒性。利用 VLM 的开放词汇功能,我们使用文本提示作为语义代理来构造由控制语义变化程度的范围参数化的转换。通过以封闭形式表征 VLM 决策边界,我们的框架定量地证明了预测类别在语义转换下保持不变的范围区间。我们的框架是第一个在语义级变化下验证 VLM 鲁棒性的框架,而不需要为每个变化提供额外的数据,使其具有实用性。对合成数据和真实数据的实验表明,我们的框架能够在跨场景的不同语义变化下证明鲁棒性。