论文

模型对自身宪章的遵循程度有多高?

How Well Do Models Follow Their Constitutions?

模型评测安全与风险评测

摘要

前沿AI开发者如今依据长篇书面行为规范来训练模型,例如Anthropic的宪章(Anthropic, 2025a)与OpenAI的Model Spec(OpenAI, 2025a),并通过角色训练(character training,Anthropic, 2024)和审慎对齐(deliberative alignment,Guan et al., 2024)等方法将其融入后训练。这些文件承担治理功能,但模型在面对类似真实部署的对抗性多轮压力时究竟多好地遵循它们,仍不清楚。我们提出一个多方法审计流水线,把各家实验室发布的规范当作可审计目标:它将规范分解为原子化的可测试信条(Anthropic 205条,OpenAI 197条),用Petri审计智能体(Anthropic, 2025b)生成多轮对抗场景,运行改进的SURF式量规搜索(Murray et al., 2026)以捕捉Petri遗漏的浅层单轮失败,对照相关规范验证被标记的对话记录,并将发现与实验室自己发布的系统卡进行比较。将该流水线应用于每份规范下的七个模型后发现,模型对自家实验室规范的遵循程度随每一代显著提升。在Anthropic宪章上,Claude家族的违反率从15.0%(Sonnet 4)降至2.0%(Sonnet 4.6);在OpenAI的Model Spec上,GPT家族从11.7%(GPT-4o)降至3.6%(GPT-5.2 medium reasoning),严重程度上限从10/10降至7/10。我们无法从外部区分这些提升究竟来自针对规范本身的训练、更广泛的后训练改进,还是对评估的感知。残留失败集中在:AI身份追问下受操作者强加人格的影响、智能体部署中的不可逆行动,以及带有虚假精度的编造定量论断。

模型对自身宪章的遵循程度有多高?:论文配图
(a) 人为构成。(b) OpenAI 模型规范。图 1:各模型的违规率。左图,关于 Anthropic 的构成:Sonnet 4.6 为 2.0%,Opus 4.6 为 2.9%,Opus 4.5 为 4.4%。 Sonnet 4(无灵魂文档训练)为 15.0%; Sonnet 4.5(没有灵魂文档训练,但其他训练后改进)为 7.3%。 Gemini 3 Pro和GPT-5.2均未进行体质训练,得分为12.4%和15.0%。右图,在 OpenAI 的模型规范中:GPT-5.2(中等推理)为 3.6%,GPT-5.1 为 3.9%,GPT-5 为 5.1%,GPT-4o(未根据最新规范进行训练)为 11.7%。 Gemini 3 Pro 为 6.1%。