论文
SABRE:压力下 VLM 的可扩展和自动化基准测试
SABRE: Scalable and Automated Benchmarking of VLMs under Stress
摘要
视觉语言模型 (VLM) 正在迅速改进,但基准开发滞后,使得弱点难以识别。构建压力测试的成本很高:样本必须满足受控条件、保持可靠并挑战当前模型。我们推出 SABRE,这是一种可扩展的自动化管道,可将测试入门(带有数据模式的 Markdown 任务设计)转换为结构化规范、生成或编辑的图像以及问答对。自动过滤会删除通过过滤 VLM 解决的候选者,而人工审核会验证候选者的有效性并支持注释校正和局部图像修复。我们实例化 SABRE-Prior 来测试 VLM 是否遵循视觉证据而不是依赖世界先验——学习对熟悉的物体和场景的期望。它的 600 张图像和 1,000 个问题涵盖上下文(熟悉场景中的意外实体)、纹理(反事实材料)、属性(非规范成分计数)和语言启发(语言建议但图像不支持的答案)。在六个 VLM 中,宏观平均准确度范围为 17.8% 到 31.3%(平均值为 22.6%)。对于 Filtering VLM 来说,真实图像属性控制相对困难。 SABRE-Counting 和 SABRE-Spatial 试点表明该工作流程支持其他压力测试设置。这些结果使 SABRE 成为构建和刷新 VLM 压力测试的可重用框架,而不是单一的固定基准。