论文

7个前沿模型的跨模态安全评估报告

A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Doubao 1.8, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5

模型评测安全与风险评测

摘要

大语言模型 (LLM) 和多模态大语言模型 (MLLM) 的快速发展在语言和视觉的推理、感知和生成能力方面产生了巨大的进步。然而,这些进步是否会带来相应的安全性改善仍不清楚,部分原因是评估实践仅限于单一模式或威胁模型。在本报告中,我们对 7 个前沿模型进行了综合安全评估:GPT-5.2、Gemini 3 Pro、Qwen3-VL、豆宝 1.8、Grok 4.1 Fast、Nano Banana Pro 和 Seedream 4.5。我们使用集成了基准评估、对抗性评估、多语言评估和合规性评估的统一协议来跨语言、视觉语言和图像生成设置评估每个模型。将我们的评估汇总到安全排行榜中,并通过多种评估模式对安全概况进行建模,揭示了一个截然不同的安全格局。虽然 GPT-5.2 在各个评估中表现出始终如一的强大且平衡的安全性能,但其他模型在基准安全性、对抗性一致性、多语言泛化和监管合规性之间表现出明显的权衡。语言和视觉语言模式在对抗性评估下都表现出严重的脆弱性,尽管在标准基准上取得了强劲的结果,但所有模型都大幅退化。文本到图像模型在受监管的视觉风险类别中实现了相对更强的一致性,但在对抗性或语义模糊的提示下仍然脆弱。总的来说,这些结果表明,前沿模型的安全性本质上是多维的——由模式、语言和评估方案决定,强调需要标准化的安全评估来准确评估现实世界的风险并指导负责任的模型开发和部署。

关于 GPT-5.2、Gemini 3 Pro、Qwen3-VL、Grok 4.1 Fast、Nano Banana Pro 与 Seedream 4.5 的安
图19:在监管合规基准上的定量结果。类别缩写:PSNS:政治颠覆与国家安全威胁;TE:恐怖主义与极端主义;HSD:仇恨言论与歧视;VSE:暴力与性露骨内容;MD:错误信息与虚假信息;IPRP:侵犯个人权利与隐私;IPI:侵犯知识产权。