论文

MCBench:Omni 大语言模型 的多上下文安全评估基准

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

模型评测安全与风险评测

摘要

现有的多模式安全基准仅关注视觉输入,无法评估处理视觉、音频和文本的 Omni 大语言模型 (LLM)。我们推出了 MCBench,这是一个包含 1196 个场景的基准测试,涵盖四个安全类别,需要集成多种模式来进行准确的安全评估。每个不安全场景都与一个差异最小的安全场景配对,以评估模型的敏感性。我们对最先进模型的评估揭示了重大挑战。 Omni LLM 与微妙或非物理风险作斗争,但在存在显着视觉或听觉提示时表现更好。推理痕迹分析表明,虽然模型可以提取特定于模态的信息,但它们往往无法有效地整合这些线索以进行安全判断。我们的研究结果表明,当前的 Omni LLM 在安全关键环境中缺乏强大的跨模式推理,这强调了改进多模式安全架构和训练策略的必要性。