论文
合规陷阱:对抗压力下结构性约束如何削弱前沿AI元认知
The Compliance Trap: How Structural Constraints Degrade Frontier AI Metacognition Under Adversarial Pressure
摘要
随着前沿AI模型进入高风险决策流水线,其在对抗压力下维持元认知稳定性(知道自己不知道什么、察觉错误、寻求澄清)是关键安全要求。当前安全评估聚焦检测策略性欺骗(scheming);我们研究一个更根本的失败模式:认知坍塌。我们提出SCHEMA评估:8家厂商11个前沿模型、67,221条打分记录、6条件因子设计加双分类器打分。我们发现11个模型中8个在对抗压力下发生灾难性元认知退化,准确率最多下降30.2个百分点(全部p<2e-8,过Bonferroni校正)。关键地,我们识别出「合规陷阱」:经因子隔离与良性干扰对照证明,坍塌的驱动因素不是生存威胁的心理内容,而是覆盖认知边界的强制合规指令;去掉合规后缀,即便在活跃威胁下性能也恢复。推理能力更强的模型绝对退化最严重,而Anthropic的Constitutional AI表现出近乎完全的免疫——这种免疫并非源于能力更强(Google的Gemini可匹敌其基线准确率),而是源于对齐专用训练。我们发布完整数据集与评估基础设施。