论文

为基准评基准:评估面向小语言模型的自动化安全基准

Benchmarking the Benchmarks: Evaluating Automated Safety Benchmarks for Small Language Models

模型评测评测方法与指标

摘要

小语言模型(SLM)越来越多地部署在资源受限、隐私敏感的场景,其中安全与偏见失败可能造成安全和社会风险。然而,现有的AI安全/安保/合规基准是为大语言模型设计的,可能无法可靠地迁移到SLM。因此我们提出问题:这些基准能否有效且可靠地评估SLM?为回答这一问题,我们在统一评审细则下,通过评估五个广泛使用的基准套件与26个开源SLM,对这些自动化流水线的有效性和稳健性进行大规模评估,该细则对有害、安全或模糊/无关响应分别赋予0、1或0.5分。各基准中模糊判定占主导,且与提示复杂度和模型架构相关,表明以LLM为中心的安全基准不足以作为SLM安全评估的独立证据。总体上,模糊率随词汇密度、输出困惑度和输出长度增加,随词汇复杂度、自洽性和回复-提示相似度下降。这揭示了一种能力-安全混淆,将模型能力与表面安全混在一起。由于模糊普遍存在,汇总均分排行榜在数学上是脆弱的:在合理的模糊处理方式下,模型排名会显著变化,即使底层输出保持不变。

为基准评基准:评估面向小语言模型的自动化安全基准:论文配图
图1:14 个模型家族中 26 个 SLM 在 5 个基准套件上的安全排名:平均分越高表明模型表现出越安全的行为。