论文
欧盟AI法案实践准则下系统性风险证据的开放流程与仪表盘
An Open Pipeline and Dashboard for Systemic-Risk Evidence under the EU AI Act's Code of Practice
摘要
关于AI安全的主张所触达的受众远超AI社区,但许多主张依赖不透明的证据或静态评估——即便支撑证据是可获取的。我们提出Systemic Risk Index,一个开放的评测流程与仪表盘,旨在使经验证据对公众更加透明、可追溯。我们的工作将19个公开基准组织进欧盟GPAI实践准则定义的四个系统性风险类别——CBRN、网络攻击、有害操纵与失控——并使用保持危害性的扰动与模拟部署情境来评测模型。交互式仪表盘允许用户在平均与最坏情况聚合之间切换、改变模型能力影响聚合得分的方式,并将每个风险评级追溯至其基准证据。在18个模型上,最坏情况聚合下得分下降14到37分,凸显了平均化模型风险评估可能隐藏的信息。LLM裁判与人类评分者的一致性达到与人与人之间相当的水平(kappa=0.78-0.82),盲审计发现83%的抽样变换保持了原有危害。在一项调查(N=21)中,大多数参与者报告得分易于理解,且该仪表盘促使他们从不同设置下查看模型评测。
