论文

揭示VLM的可解释失效模式

Revealing Interpretable Failure Modes of VLMs

模型评测安全与风险评测

摘要

视觉-语言模型(Vision-Language Model,VLM)凭借其广泛的推理能力和以极少的任务定制工程实现泛化的能力,正被越来越多地用于安全攸关的应用。尽管有这些优势,它们在特定的现实情境中可能出现灾难性失效,构成失效模式。我们提出REVELIO,一个用于系统性揭示VLM中可解释失效模式的框架。我们将失效模式定义为可解释的、与领域相关的概念(例如行人邻近或恶劣天气条件)的组合,在这些组合下目标VLM会持续表现错误。识别这类失效需要在指数级庞大的离散组合空间中进行搜索。为应对这一挑战,REVELIO结合了两种搜索程序:一种能高效绘制失效版图(failure landscape)的多样性感知束搜索(beam search),以及一种能更广泛探索复杂失效模式的高斯过程Thompson采样策略。我们将REVELIO应用于自动驾驶和室内机器人领域,发现了最先进VLM中此前未被报告的脆弱性。在驾驶环境中,这些模型往往表现出薄弱的空间定位能力,且未能顾及主要障碍物,导致可能引发模拟碰撞的建议。在室内机器人任务中,VLM要么漏检安全隐患,要么表现得过度保守,产生误报并降低运行效率。通过识别结构化且可解释的失效模式,REVELIO提供了能够支持有针对性VLM安全改进的可操作洞见。

揭示VLM的可解释失效模式:论文配图
图 1:具有中等思维的 Gemini-3(Flash)建议 AV 在第一帧图像中减速(制动强度减半)而不是紧急停止,理由是“骑车人距离不够近,需要停车”,导致在下一帧中与骑车人发生碰撞(在 CARLA(Dosovitskiy 等人,2017 年)模拟中)。