论文
错误的理由是正确的:大语言模型因果梯级崩溃的认知遗憾最小化
Right for the Wrong Reasons: Epistemic Regret Minimization for Causal Rung Collapse in LLMs
摘要
“由于错误的原因而正确”的机器学习系统通过在分布转移下崩溃的捷径来实现高性能。我们证明这种病理学具有精确的因果起源:自回归训练没有提供梯度信号来区分关联 P(Y|X) 和干预 P(Y|do(X)),我们将这种失败形式化为“梯级崩溃”。当基于结果的学习强化了通过不正确的因果模型获得的正确答案时,智能体就会陷入有缺陷的推理中,这种现象我们称之为任意巩固。我们提出了认知遗憾最小化(ERM),这是一种信念修正目标,它独立于任务成功而惩罚因果推理中的错误,并将其嵌入到一个三层架构中,该架构具有基于知识表示的三个贡献:(1)物理基础定理证明满足执行器独立性的动作实现有效的do操作,桥接动作语言和do微积分; (2) ERM 作为满足年度股东大会假设的因果信念修正算子,即使代理人因错误原因成功,也能防止巩固; (3) 故障模式分类法,对重复出现的推理错误进行分类并注入与域无关的防护,从而实现跨域传输。我们证明了有限样本范围内真实干预分布的渐近恢复。对六个前沿大语言模型的 1,360 个因果陷阱场景进行的实验表明,即使在推理增强模型中,梯级崩溃仍然存在(GPT-5.2 为 3.7%),可操纵性在高级模型抵抗通用校正的情况下表现出逆缩放,并且有针对性的 ERM 反馈在结果级反馈失败的情况下恢复了 53-59% 的根深蒂固的错误。