论文

协调AI安全阈值

Harmonizing AI Safety Thresholds

模型评测安全与风险评测

摘要

前沿AI公司发布的能力阈值差异巨大,第三方难以验证某阈值是否被跨越,也难以在不同公司的要求之间比较。此外,缺乏共同的最低阈值时,风险缓解可能不一致,可能在安全标准上形成逐底竞争。我们开发了一套在三个风险领域推导协调阈值的方法。对滥用风险(网络与生物),我们以期望伤害为关键原语,采用显式的风险建模方法,计入风险通道与模型发布条件。对自动化AI研发,我们把提议的阈值建立在可观察的AI进展速率而非期望伤害之上。我们的分析扩展了先前工作,并指出当前的经验缺口与局限。

协调AI安全阈值:论文配图
图1:自动化AI研发门槛示意图。