论文
协调AI安全阈值
Harmonizing AI Safety Thresholds
摘要
前沿AI公司发布的能力阈值差异巨大,第三方难以验证某阈值是否被跨越,也难以在不同公司的要求之间比较。此外,缺乏共同的最低阈值时,风险缓解可能不一致,可能在安全标准上形成逐底竞争。我们开发了一套在三个风险领域推导协调阈值的方法。对滥用风险(网络与生物),我们以期望伤害为关键原语,采用显式的风险建模方法,计入风险通道与模型发布条件。对自动化AI研发,我们把提议的阈值建立在可观察的AI进展速率而非期望伤害之上。我们的分析扩展了先前工作,并指出当前的经验缺口与局限。
