论文

欧盟AI法案实践准则下系统性风险证据的开放流程与仪表盘

An Open Pipeline and Dashboard for Systemic-Risk Evidence under the EU AI Act's Code of Practice

模型评测评测方法与指标

摘要

关于AI安全的主张所触达的受众远超AI社区,但许多主张依赖不透明的证据或静态评估——即便支撑证据是可获取的。我们提出Systemic Risk Index,一个开放的评测流程与仪表盘,旨在使经验证据对公众更加透明、可追溯。我们的工作将19个公开基准组织进欧盟GPAI实践准则定义的四个系统性风险类别——CBRN、网络攻击、有害操纵与失控——并使用保持危害性的扰动与模拟部署情境来评测模型。交互式仪表盘允许用户在平均与最坏情况聚合之间切换、改变模型能力影响聚合得分的方式,并将每个风险评级追溯至其基准证据。在18个模型上,最坏情况聚合下得分下降14到37分,凸显了平均化模型风险评估可能隐藏的信息。LLM裁判与人类评分者的一致性达到与人与人之间相当的水平(kappa=0.78-0.82),盲审计发现83%的抽样变换保持了原有危害。在一项调查(N=21)中,大多数参与者报告得分易于理解,且该仪表盘促使他们从不同设置下查看模型评测。

欧盟AI法案实践准则下系统性风险证据的开放流程与仪表盘:论文配图
图 1:仪表盘概览。该仪表盘汇总模型或提供商在四个系统性风险类别上的结果。用户可以在提供商视图与模型视图之间切换,比较平均值与最坏情况两种聚合方式,调整能力权重,并展开各风险项以查看基准明细。行展开见图 5,完全展开的仪表盘见附录(图 6)。