论文

寻找“有害拒绝”:人工智能安全基准的心理测量审计

Searching for "Harmful Refusal": A Psychometric Audit of an AI Safety Benchmark

模型评测评测方法与指标安全与风险评测

摘要

安全基准通常会报告一组数据集的一个总体得分,每个数据集可能针对一个或多个与安全相关的属性,因此具有相似总体得分的模型可能具有非常不同的属性配置文件。在单个属性级别上比较模型更容易处理,但通常不清楚单个数据集的分数是否隔离任何单个属性。这种属性的一个可能的候选者是有害拒绝,即模型拒绝危险或违反政策的提示的倾向。我们检查它是否构成 HELM Safety 中的单一可测量属性。使用构造有效性框架,该框架规定属性必须存在,然后测试才能测量它,我们从 HELM Safety 的四个数据集开始,这些数据集可能有理由针对有害拒绝,但发现三个数据集已饱和。我们对剩余的数据集 HarmBench 进行了两项心理测试,以确定诸如有害拒绝之类的单一属性是否可以支持其得分。首先,多维项目反应理论建模强烈表明 HarmBench 并不 衡量单一属性。其次,差异项目功能分析发现具有相同拒绝能力的不同开发者的模型得分不同的项目。这些标志在特定范围的匹配下很大程度上消失了,这种模式与聚合效应一致,但不足以排除特定领域的开发人员差异。缩小范围后,HarmBench 将不同的伤害行为合并为一个分数,而整体 HELM 安全聚合进一步将 HarmBench 和其他数据集的分数合并为一个顶线数字。任何对数据集和项目进行平均的安全评分都可以隐藏饱和度并以这种方式合并行为。我们认为,在与模型进行比较之前,分数应该获得其单属性读数。