模型对自身宪章的遵循程度有多高?
How Well Do Models Follow Their Constitutions?
摘要
前沿AI开发者如今依据长篇书面行为规范来训练模型,例如Anthropic的宪章(Anthropic, 2025a)与OpenAI的Model Spec(OpenAI, 2025a),并通过角色训练(character training,Anthropic, 2024)和审慎对齐(deliberative alignment,Guan et al., 2024)等方法将其融入后训练。这些文件承担治理功能,但模型在面对类似真实部署的对抗性多轮压力时究竟多好地遵循它们,仍不清楚。我们提出一个多方法审计流水线,把各家实验室发布的规范当作可审计目标:它将规范分解为原子化的可测试信条(Anthropic 205条,OpenAI 197条),用Petri审计智能体(Anthropic, 2025b)生成多轮对抗场景,运行改进的SURF式量规搜索(Murray et al., 2026)以捕捉Petri遗漏的浅层单轮失败,对照相关规范验证被标记的对话记录,并将发现与实验室自己发布的系统卡进行比较。将该流水线应用于每份规范下的七个模型后发现,模型对自家实验室规范的遵循程度随每一代显著提升。在Anthropic宪章上,Claude家族的违反率从15.0%(Sonnet 4)降至2.0%(Sonnet 4.6);在OpenAI的Model Spec上,GPT家族从11.7%(GPT-4o)降至3.6%(GPT-5.2 medium reasoning),严重程度上限从10/10降至7/10。我们无法从外部区分这些提升究竟来自针对规范本身的训练、更广泛的后训练改进,还是对评估的感知。残留失败集中在:AI身份追问下受操作者强加人格的影响、智能体部署中的不可逆行动,以及带有虚假精度的编造定量论断。
