论文
OOD-MMSafe:从有害意图推进到隐藏后果的多模态安全
OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences
摘要
多模态大语言模型(MLLM)的安全对齐虽备受关注,现有范式主要针对恶意意图或情境性违规。我们提议把安全前沿转向后果驱动安全,这一范式对自主与具身智能体的稳健部署至关重要。为形式化这一转变,我们提出含455个精编查询-图像对的基准OOD-MMSafe,评估模型在情境依赖因果链中识别潜在危险的能力。分析显示前沿模型普遍存在因果盲视,高容量闭源模型失败率最高达67.5%;并发现「偏好天花板」:随模型容量增长,静态对齐只带来格式化失败而非安全推理改善。为突破这些瓶颈,我们提出后果感知安全策略优化(CASPO)框架,把模型内在推理作为动态参考用于词元级自蒸馏奖励。实验表明CASPO显著增强后果推断能力,把风险识别失败率降至Qwen2.5-VL-7B的7.3%与Qwen3-VL-4B的5.7%,同时保持整体效能。
