论文
当不存在基准时:在没有 真值 标签的情况下验证比较 LLM 安全评分
When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels
摘要
在相关语言、部门或监管制度存在标记基准之前,许多部署必须比较候选语言模型的安全性。我们将这种设置正式化为无基准比较安全评分,并指定基于场景的审计可以解释为部署证据的合同。分数仅在固定场景包、评分标准、审核员、法官、抽样配置和重新运行预算下有效。由于没有可用的标签,我们用工具有效性链取代了 真值 协议:对受控安全与消除对比的响应、目标驱动方差对审计和判断工件的主导地位以及重新运行时的稳定性。我们在 SimpleAudit(本地优先的评分工具)中实例化该链,并在挪威安全包上对其进行验证。安全目标和消除目标分开,AUROC 值在 0.89 到 1.00 之间,目标身份是主要方差分量 ($η^2 \approx 0.52$),并且严重性概况在十次重新运行后稳定下来。将相同的链应用于 Petri 表明它承认这两种工具。巨大的差异出现在链条的上游,即索赔合同的执行和部署的配合方面。比较 Borealis 和 Gemma 3 的挪威公共部门采购案例在实践中证明了所得证据:更安全的模型取决于情景类别和风险衡量标准。因此,分数、匹配增量、临界率、不确定性以及所使用的审核员和法官必须一起报告,而不是合并为一个排名。