论文

MME-Safety:MLLM 安全评估的细粒度基准

MME-Safety: A Fine-grained Benchmark for Safety Evaluation of MLLMs

模型评测基准与评测资源

摘要

虽然多模态大型语言模型(MLLM)显示出显着的进步,但它们的跨模态功能引入了容易绕过单模态过滤器的复杂漏洞。现有的基准缺乏细粒度的意图相关注释,并且依赖于一维指标,阻碍了全面的鲁棒性评估。为了解决这个问题,我们提出了 MME-Safety,这是一个经过严格验证的基准,具有独特的四维注释模式,可对风险场景、危害严重程度和特定模式的隐形级别进行分类。此外,我们引入了一个分层评估框架来评估基本响应可靠性、实际风险暴露和防御行为的结构完整性。对 17 个最先进的 MLLM 进行广泛的零样本评估,提供了当前多式联运系统的全面安全概况。我们的分析系统地研究了跨模式输入配置,并揭示了与思想链 (CoT) 推理相关的安全隐患。这些多方面的发现强调了在多模式环境中迫切需要强大的、具有推理意识的安全协调。