论文

前沿 AI 风险管理框架实践:风险评估技术报告 v1.5

Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report v1.5

模型评测安全与风险评测

摘要

为理解和识别快速推进的人工智能(AI)模型带来的前所未有风险,Frontier AI Risk Management Framework in Practice 对其前沿风险进行了全面评估。随着大语言模型(LLM)通用能力快速演进和 Agentic AI 的扩散,本版风险分析技术报告对五个关键维度给出更新且更细粒度的评估:网络攻击、说服与操纵、策略性欺骗、失控的 AI 研发以及自我复制。具体而言,我们为网络攻击引入了更复杂的场景。对于说服与操纵,我们在新发布的 LLM 上评估 LLM 对 LLM 说服的风险。对于策略性欺骗与密谋,我们新增关于涌现失准(emergent misalignment)的实验。对于失控的 AI 研发,我们关注智能体自主扩展记忆载体与工具集时的“误进化”。此外,我们还监测并评估了 OpenClaw 在 Moltbook 上交互时的安全表现。对于自我复制,我们引入新的资源受限场景。更重要的是,我们提出并验证了一系列鲁棒的缓解策略以应对这些新出现的威胁,为前沿 AI 的安全部署提供了初步、技术上可操作的路径。本工作反映了我们对 AI 前沿风险的当前理解,并呼吁采取集体行动缓解这些挑战。

前沿 AI 风险管理框架实践:风险评估技术报告 v1.5
图3:迭代式红蓝对抗循环概览。在每个状态t,红队探测环境(1)以生成漏洞报告(2)。蓝队利用该报告施加补丁(3),将系统更新到状态t+1(4)。最后的验证(5)确认漏洞是否得到缓解。