论文
V-DEAL:诊断视频安全去校准为理解—拒绝耦合失败
V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure
摘要
随着视频大语言模型日益部署于真实应用,确保其安全对齐变得关键。反直觉的是,我们发现有害视频配良性查询的攻击成功率高于同一视频配显式有害查询。为理解该脆弱性的底层机制,我们提出V-DEAL,一个三级诊断框架:跨模型行为、理解与内部表示联合分析该失败。经逐步排除感知失败并量化模型内部拒绝倾向,V-DEAL为分析所观察脆弱性的底层机制提供新的诊断视角。我们在三个公开基准上测试六个视频LLM:模型以超过81%的准确率正确识别有害视频内容,但在有害视频配良性查询的条件下平均攻击成功率仍达48.33%。隐状态分析进一步显示视觉理解激活的拒绝倾向弱于文本理解。此外我们引入提示注入干预方法:把攻击成功率平均降低48.24个百分点,达到与既往基于微调方法可比的表现——为解决视频LLM此类安全风险提供有效且实用的手段。
