论文
CSR-Bench:评测MLLM跨模态安全性与可靠性的基准
CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs
摘要
多模态大语言模型(MLLM)支持文本与图像两种模态的交互,但其安全行为可能由单模态捷径驱动,而非真正的联合意图理解。我们提出CSR-Bench,一个通过四种压力测试交互模式评估跨模态可靠性的基准,覆盖安全、过度拒答、偏见与幻觉,共61种细粒度类型。每个实例都被构建为需要图文联合解读,我们还额外提供成对的纯文本对照,以诊断由模态引起的行为变化。我们评估16个最先进的MLLM,观察到系统性的跨模态对齐差距:模型安全意识薄弱,在干扰下表现出强烈的语言主导,且从纯文本对照到多模态输入性能持续下降。我们还观察到降低过度拒答与保持安全、无歧视行为之间存在明显权衡,这表明某些表面上的安全提升可能来自面向拒答的启发式策略,而非稳健的意图理解。警告:本文包含不安全内容。
