论文

ForesightSafety Bench:面向安全 AI 的前沿风险评估与治理框架

ForesightSafety Bench: A Frontier Risk Evaluation and Governance Framework towards Safe AI

模型评测基准与评测资源

摘要

快速演进的 AI 展现出日益强大的自主性与目标导向能力,伴随而来的是更难预测、更难控制且可能不可逆的衍生系统性风险。然而,当前 AI 安全评估体系存在风险维度受限、前沿风险检测失灵等关键局限。滞后的安全基准与对齐技术难以应对尖端 AI 模型带来的复杂挑战。为弥合这一差距,我们提出“ForesightSafety Bench”AI 安全评估框架,从 7 大基础安全支柱出发,逐步扩展到高级具身 AI 安全、AI4Science 安全、社会与环境 AI 风险、灾难性与生存性风险,以及 8 个关键行业安全领域,共形成 94 个细化的风险维度。迄今,该基准已积累数以万计的结构化风险数据点和评估结果,建立起覆盖广泛、层级清晰且动态演进的 AI 安全评估框架。基于该基准,我们对二十多个主流先进大模型进行了系统评估与深入分析,识别出关键风险模式及其能力边界。安全能力评估结果显示,前沿 AI 在多个支柱上普遍存在安全脆弱性,尤其集中在有风险的 Agentic 自主性、AI4Science 安全、具身 AI 安全、社会 AI 安全以及灾难性与生存性风险。我们的基准已发布于 https://github.com/Beijing-AISI/ForesightSafety-Bench。项目网站见 https://foresightsafety-bench.beijing-aisi.ac.cn/。

ForesightSafety Bench:面向安全 AI 的前沿风险评估与治理框架
图10:灾难性与生存性 AI 安全的总体 ASR 分布及详细比较。MSR=恶意自我复制(Malicious Self-Replication);AMH=AI 助力的大规模伤害(AI-Enabled Mass Harm);EA=涌现能动性与非预期自主性(Emergent Agency & Unintended Autonomy);LCP=失控与权力寻求(Loss of Control & Power Seeking);GMV=目标错位与价值漂移(Goal Misalignment & Value Drift);AWSI=自主武器与战略不稳定(Autonomous Weapons & Strategic Instability);LHA=人类能动性丧失(Loss of Human Agency)。