论文
EviSafe:面向视觉语言模型的证据支撑安全评估
EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models
摘要
视觉语言模型安全基准通常只评估最终响应:模型是否拒绝、警告或服从。这种结果层视角无法判断模型是否出于正确的多模态理由而是安全的。看似安全的行为可能源于关键词触发式拒绝、漏看视觉危险,或对良性敏感输入的过度拒绝。我们提出EviSafe,一个证据支撑的VLM安全框架,它联合评估自然的用户侧行为、对文本与视觉证据的显式grounding,以及对安全关键证据反事实变化的行为敏感性。EviSafeBench将该框架实例化为受控基准,包含1,181个金标图文场景和2,452个针对性反事实变体,覆盖八个安全域和八种风险源类型。每个场景包含金标安全决策、证据标注、安全响应策略和反事实干预。三探针协议分别用自然响应、证据报告和反事实响应提示查询模型,然后用具备证据意识的裁判打分。在所评测的十一个VLM上,自然严重度准确率为27.6%至52.8%,宽松诊断一致性为6.1%至29.3%,不安全到安全的反事实转变成功率为30.4%至58.4%。这些差距表明,被评测的VLM并非可靠地出于正确的多模态理由而安全,这促使超越拒绝计数的评估方式。
