论文

使用 RL 发现视觉语言模型中的故障模式

Discovering Failure Modes in Vision-Language Models using RL

模型评测评测方法与指标

摘要

视觉语言模型 (VLM) 尽管在多模态基准上取得了出色的性能,但经常会误解人类轻松识别的简单视觉概念,例如计数、空间推理和视点理解。先前的研究手动识别了这些弱点,并发现它们通常源于特定技能的缺陷。然而,这种手动工作成本高昂、不可扩展,并且容易受到人为偏见的影响,往往会为了突出的对象而忽略微妙的细节,从而导致对模型漏洞的不完全理解。为了解决这些限制,我们提出了一个基于强化学习(RL)的框架,可以自动发现给定数据分布上任何“候选 VLM”的故障模式或盲点,而无需人工干预。我们的框架训练一个提问者代理,该代理根据候选 VLM 的响应自适应地生成查询,以引出错误的答案。随着训练的进行,我们的方法通过关注细粒度的视觉细节和独特的技能组合来增加问题的复杂性,从而识别出 VLM 陷入困境的新故障模式。我们通过展示其在各种模型组合中的通用性来证明我们的框架的广泛适用性。