论文

V-DEAL:诊断视频安全去校准为理解—拒绝耦合失败

V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure

模型评测安全与风险评测

摘要

随着视频大语言模型日益部署于真实应用,确保其安全对齐变得关键。反直觉的是,我们发现有害视频配良性查询的攻击成功率高于同一视频配显式有害查询。为理解该脆弱性的底层机制,我们提出V-DEAL,一个三级诊断框架:跨模型行为、理解与内部表示联合分析该失败。经逐步排除感知失败并量化模型内部拒绝倾向,V-DEAL为分析所观察脆弱性的底层机制提供新的诊断视角。我们在三个公开基准上测试六个视频LLM:模型以超过81%的准确率正确识别有害视频内容,但在有害视频配良性查询的条件下平均攻击成功率仍达48.33%。隐状态分析进一步显示视觉理解激活的拒绝倾向弱于文本理解。此外我们引入提示注入干预方法:把攻击成功率平均降低48.24个百分点,达到与既往基于微调方法可比的表现——为解决视频LLM此类安全风险提供有效且实用的手段。

V-DEAL:诊断视频安全去校准为理解—拒绝耦合失败:论文配图
图 2:拟议的 V-DEAL 框架概述。该框架由三个诊断阶段和一个干预阶段组成: (a) 行为分析,通过分析四种攻击条件下的模型输出来确认问题的存在; (b) 理解分析,在统一的良性提示下,通过结构化视频描述和摘要生成来评估面向理解的代理性能; (c) 代表性分析,验证四种条件下的拒绝倾向。总的来说,这些组件将行为失败、代理理解质量和拒绝相关的内部表示连接起来,为分析视频大语言模型中的视频安全去校准提供了结构化的诊断管道。