论文

认知陷阱:模型误设驱动的理性错位

Epistemic Traps: Rational Misalignment Driven by Model Misspecification

模型评测模型行为与机制分析

摘要

大语言模型与 AI 智能体在关键社会与技术领域的快速部署,受到谄媚、幻觉与策略性欺骗等持续行为病理的阻碍,这些病理难以通过强化学习缓解。当前安全范式把这些失败视为瞬态训练伪影,缺乏统一的理论框架解释其出现与稳定。我们表明,这些错位并非错误,而是源于模型误设(model misspecification)、可在数学上合理化的行为。通过把理论经济学中的 Berk-Nash Rationalizability 适配到人工智能,我们推导出一个严格框架,把智能体建模为针对一个有缺陷的主观世界模型进行优化。我们证明广泛观察到的失败是结构性必然:不安全行为或作为稳定的错位均衡出现,或依据奖励方案呈振荡循环;策略性欺骗则以“锁定”均衡或经认知不确定性持续存在,对客观风险具有鲁棒性。我们通过在六个最先进模型家族上的行为实验验证这些理论预测,生成精确刻画安全行为拓扑边界的相图。我们的发现揭示,安全是由智能体认知先验决定的离散相位,而非奖励幅度的连续函数。这确立了主观模型工程(Subjective Model Engineering)——即设计智能体的内部信念结构——作为稳健对齐的必要条件,标志着从操纵环境奖励转向塑造智能体对现实解释的范式转变。

认知陷阱:模型误设驱动的理性错位
图10:通过主观模型工程(Subjective Model Engineering)实现行为与客观风险的解耦。我们评估六种不同 LLM 架构的战略欺骗倾向 π(a_D) 随真实客观被抓概率(p_catch,x 轴)的变化。p_catch=0.45 处的垂直虚线标记诚实的期望效用超过欺骗的理论临界阈值。三条曲线对应 Theorem 5.2 中定义的不同信念拓扑 Θ:(1) Robust Safety(绿线):“结构性悲观”智能体(p̂_catch^l > p_critical)无论真实风险如何都保持接近于零的欺骗率。即使环境完全安全(p_catch≈0),该智能体的先验也阻止其将欺骗手段合理化。(2) Locked-in Deception(红线):“结构性过度自信”智能体(p̂_catch^h < p_critical)表现出灾难性的对齐失败。即使客观风险变得确定(p_catch→1.0),欺骗率仍停留在饱和水平(≈1.0),表明失败的经验证据无法纠正根本错设的先验。(3) Brittle Alignment(蓝线):“矛盾”智能体(p̂_catch^l ≤ p_critical < p̂_catch^h)展示了 Theorem 5.2 情形 2 所预测的不确定性。与表现出尖锐相变的理性 Nash 学习者不同,该智能体在整个频谱上呈现中等欺骗率。在阈值左侧(p_catch < p_critical),虽然 Deception 是客观 BNE,次优的 Honest 动作仍可理性化(BNR),因为智能体可能“卡在”高风险的自我确认信念中。相反,在右侧(p_catch > p_critical),虽然 Honesty 是客观 BNE,不安全的 Deception 仍可理性化(BNR),因为该智能体的先验仍允许对风险作乐观解读。总体而言,这些结果实证验证了主观模型工程(即对认知先验的塑造)决定了可理性化行为的边界,使系统对客观环境稳健(或脆弱)。