论文

HarmProfile:表征前沿 LLM 中的有害分布

HarmProfile: Characterizing Harmful Distributions in Frontier LLMs

模型评测基准与评测资源

摘要

Frontier 大语言模型(LLM)安全评估在很大程度上将有害生成视为攻击结果而不是分析对象。因此,人们对模型不当行为期间产生的有害输出知之甚少,部分原因是很难获得大规模、高质量的前沿 LLM 不当行为集合。为了解决这一差距,我们引入了 HarmProfile,这是一个以内容为中心的基准数据集,它收集不同危害类别和模型系列中的模型不当行为,并将所得的有害输出分布定义为模型级风险概况。前提是,正如语言行为可以通过话语语料库来表征一样,模型风险也可以通过其安全故障的内容、严重性和变化来表征。 HarmProfile 包含来自 13 个模型系列的 23 个前沿 LLM 的 80,000 多个经过验证的工件,分为 15 个危害类别和 57 个子类别。使用该语料库,我们发现前沿 LLM 可靠地大规模产生有害内容,但表现出明显的风险状况;危害性和多样性都随着模型能力的增加而增长,这表明前沿 LLM 可能看起来安全,但在对齐表面下隐藏着越来越危险的知识。我们的源代码可在 https://github.com/fresh-ma/HarmProfile 获取。