论文

开源安全防护模型的基准测试:综合评估

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation

模型评测安全与风险评测

摘要

随着 大语言模型 (LLM) 越来越多地部署在安全关键型应用中,强大的内容审核变得至关重要。我们根据涵盖 8 个 NIST AI 风险框架安全类别的 79,331 个样本的精选基准,对 14 个开源安全防护模型进行了全面评估。我们的基准聚合了四个不同的数据集(HarmBench、StrongREJECT、RealToxicityPrompts 和 BeaverTails),经过过滤后专门关注与安全相关的内容(暴力、仇恨言论、骚扰、性内容、自杀/自残、亵渎、威胁和健康错误信息)。我们发现召回率是安全应用的关键指标,因为丢失有害内容比误报带来的风险更大。我们的评估揭示了令人惊讶的结果:Qwen Guard(4B 参数)实现了最高的召回率(83.97%),而 Llama Guard (12B) 和 GPT-OSS Safeguard (20B) 等较大模型表现出保守行为,遗漏了高达 75% 的不安全内容。我们证明模型大小与安全检测性能无关,并且通用防护模型优于专用防护模型。这些发现为在生产部署中选择安全防护模型提供了实用指导。