大语言模型与 AI 智能体在关键社会与技术领域的快速部署,受到谄媚、幻觉与策略性欺骗等持续行为病理的阻碍,这些病理难以通过强化学习缓解。当前安全范式把这些失败视为瞬态训练伪影,缺乏统一的理论框架解释其出现与稳定。我们表明,这些错位并非错误,而是源于模型误设(model misspecification)、可在数学上合理化的行为。通过把理论经济学中的 Berk-Nash Rationalizability 适配到人工智能,我们推导出一个严格框架,把智能体建模为针对一个有缺陷的主观世界模型进行优化。我们证明广泛观察到的失败是结构性必然:不安全行为或作为稳定的错位均衡出现,或依据奖励方案呈振荡循环;策略性欺骗则以“锁定”均衡或经认知不确定性持续存在,对客观风险具有鲁棒性。我们通过在六个最先进模型家族上的行为实验验证这些理论预测,生成精确刻画安全行为拓扑边界的相图。我们的发现揭示,安全是由智能体认知先验决定的离散相位,而非奖励幅度的连续函数。这确立了主观模型工程(Subjective Model Engineering)——即设计智能体的内部信念结构——作为稳健对齐的必要条件,标志着从操纵环境奖励转向塑造智能体对现实解释的范式转变。