论文

幻觉作为轨迹承诺:Transformer 一代中不对称吸引子动力学的因果证据

Hallucination as Trajectory Commitment: Causal Evidence for Asymmetric Attractor Dynamics in Transformer Generation

模型评测模型行为与机制分析

摘要

我们提出的因果证据表明,自回归语言模型中的幻觉是由不对称吸引子动力学控制的早期轨迹承诺。使用相同提示分岔,我们重复采样相同的输入以观察自发发散,我们将轨迹动态与提示级混杂因素隔离开来。在 Qwen2.5-1.5B 上,跨越 6 个类别的 61 个提示,其中 27 个提示 (44.3%) 在第一个生成的标记处事实轨迹和幻觉轨迹分叉(第 0 步 KL = 0,第 1 步 KL > 1.0)。跨 28 层的激活修补揭示了明显的因果不对称性:将幻觉激活注入正确的轨迹会破坏 87.5% 的试验(第 20 层)的输出,而反向仅恢复 33.3%(第 24 层);均超过 10.4% 基线 (p = 0.025) 和 12.5% 随机斑块对照。修补窗口表明纠正需要持续的多步骤干预,而腐败只需要一次扰动。探测提示编码本身,第 0 步残差状态预测第 15 层 Pearson r = 0.776 处的每次提示幻觉率(相对于 1000 排列零,p < 0.001);无监督聚类识别出 5 个类政权组 (eta^2 = 0.55),其鞍状相邻集群集中了 13 个分叉假前提提示中的 12 个,表明​​盆地结构是围绕固定于提示编码的政权承诺组织的。这些发现将幻觉描述为局部稳定的吸引子盆地:进入是概率性的且快速的,退出需要跨层和步骤的协调干预,并且相关盆地是由在步骤 0 处已经可辨别的可聚类机制选择的。