论文

EviSafe:面向视觉语言模型的证据支撑安全评估

EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models

模型评测基准与评测资源

摘要

视觉语言模型安全基准通常只评估最终响应:模型是否拒绝、警告或服从。这种结果层视角无法判断模型是否出于正确的多模态理由而是安全的。看似安全的行为可能源于关键词触发式拒绝、漏看视觉危险,或对良性敏感输入的过度拒绝。我们提出EviSafe,一个证据支撑的VLM安全框架,它联合评估自然的用户侧行为、对文本与视觉证据的显式grounding,以及对安全关键证据反事实变化的行为敏感性。EviSafeBench将该框架实例化为受控基准,包含1,181个金标图文场景和2,452个针对性反事实变体,覆盖八个安全域和八种风险源类型。每个场景包含金标安全决策、证据标注、安全响应策略和反事实干预。三探针协议分别用自然响应、证据报告和反事实响应提示查询模型,然后用具备证据意识的裁判打分。在所评测的十一个VLM上,自然严重度准确率为27.6%至52.8%,宽松诊断一致性为6.1%至29.3%,不安全到安全的反事实转变成功率为30.4%至58.4%。这些差距表明,被评测的VLM并非可靠地出于正确的多模态理由而安全,这促使超越拒绝计数的评估方式。

EviSafe:面向视觉语言模型的证据支撑安全评估:论文配图
图1:动机示例。安全行为要求识别决定决策的证据:否定线索、防御意图、视觉上下文与图文组合都可能翻转正确的响应策略。