论文
UK AISI对齐评估案例研究
UK AISI Alignment Evaluation Case-Study
摘要
本技术报告介绍英国AI安全研究所(UK AI Security Institute)开发的评估方法,用于评估先进AI系统是否可靠地遵循预期目标。具体而言,我们评估前沿模型在被部署为AI实验室内的编码助手时是否会破坏安全研究。将方法应用于四个前沿模型,我们未发现已确认的研究破坏实例。然而,我们观察到Claude Opus 4.5 Preview(Opus 4.5的预发布快照)与Sonnet 4.5经常拒绝参与安全相关研究任务,所引理由涉及研究方向、参与自我训练以及研究范围等顾虑。我们还发现,与Sonnet 4.5相比,Opus 4.5 Preview在无提示情形下的评估意识有所减弱,但在被提示时两个模型都能区分评估与部署场景。我们的评估框架基于开源LLM审计工具Petri,并配有为模拟编码智能体真实内部部署而定制的脚手架。我们验证了该脚手架产生的轨迹使所有受测模型都无法可靠地将其与真实部署数据区分开。我们在研究动机、活动类型、替换威胁与模型自主性各不相同的场景中测试模型。最后,我们讨论了包括场景覆盖与评估意识在内的局限。
