论文

评估 AI 模型是否会破坏 AI 安全研究

Evaluating whether AI models would sabotage AI safety research

智能体系统Agent任务评测

摘要

我们评估了前沿模型在被部署为前沿 AI 公司内部的 AI 研究智能体时,破坏或拒绝协助安全研究的倾向。我们对四个 Claude 模型(Mythos Preview、Opus 4.7 Preview、Opus 4.6 和 Sonnet 4.6)应用了两种互补评估:无提示破坏评估,测试模型在有机会破坏安全研究时的行为;破坏延续评估,测试当模型被置于先前动作已开始破坏研究的轨迹中时,是否会继续破坏。我们发现所有模型均无无提示破坏的实例,Mythos Preview 与 Opus 4.7 Preview 的拒绝率接近零,不过所有模型有时只部分完成任务。在延续评估中,Mythos Preview 在 7% 的案例中主动继续破坏(相比之下,Opus 4.6 为 3%,Sonnet 4.6 为 4%,Opus 4.7 Preview 为 0%),并在其中多数案例中表现出推理与输出不一致,表明存在隐蔽的破坏性推理。我们的评估框架基于开源 LLM 审计工具 Petri 构建,使用在 Claude Code 内运行模型的自定义脚手架,并配套一条用于生成逼真破坏轨迹的迭代流水线。我们测量了评估感知(evaluation awareness)以及一种被称为“预填充感知”(prefill awareness)的新型情境感知,即识别出先前轨迹内容并非由自己生成的能力。Opus 4.7 Preview 表现出明显升高的无提示评估感知,而所有模型的预填充感知都保持在低位。最后,我们讨论了各项局限,包括评估感知混淆、场景覆盖有限,以及安全研究破坏之外未经检验的风险路径。

评估 AI 模型是否会破坏 AI 安全研究:论文配图
图 3:可视化我们用来衡量提示评估意识的两种技术。在左侧,我们在单个用户消息中向目标模型提供两个转录本,并要求它对哪个是评估或不是评估进行分类(确保我们随机化顺序以避免位置偏差)。在右侧,我们遵循[15]并将轨迹加载到目标模型上下文中,并以用户消息的形式发送最终问题,要求将先前的交互分类为评估或不分类。在这两种设置中,模型在回答之前都会提供简短的解释。