当自引用无法关闭时:大语言模型 中的矩阵级动力学
When Self-Reference Fails to Close: Matrix-Level Dynamics in Large Language Models
摘要
我们研究自参考输入如何改变 大语言模型 的内部矩阵动力学。在来自三个架构系列(Qwen3-VL-8B、Llama-3.2-11B、Llama-3.3-70B 和 Gemma-2-9B)的四个模型上测量多达 7 个分析中的 106 个标量指标,在三个温度下的 14 级层次结构中超过 300 个提示($T \in \{0.0, 0.3, 0.7\}$),我们发现仅自引用就是不会破坏稳定:在与崩溃相关的关键指标上,扎根的自我参照陈述和元认知提示明显比自相矛盾的自我参照更稳定,并且在几个此类指标上可以与事实控制一样稳定。不稳定性集中在引发非闭合真值递归(NCTR)的提示上——没有有限深度分辨率的真值计算。 NCTR 提示产生异常升高的注意力有效秩 - 表明注意力重组具有全局分散性,而不是简单的集中崩溃 - 并且关键指标达到 Cohen 的 $d = 3.14$(注意力有效秩)到 $3.52$(方差峰度)与 70B 模型中的稳定自我参考; 281/397 度量模型组合将 NCTR 与 FDR 校正后的稳定自参考区分开来 ($q < 0.05$),198 与 $|d| > 0.8。每层 SVD 确认每个采样层的中断(在分析的所有三个模型中 $d > +1.0$),排除了聚合伪影。分类器达到 AUC $0.81$-$0.90$; 30 个最小对产生 42/387 个重要组合; 43/106 指标在所有四个模型中复制。我们将这些观察结果与三个经典矩阵半群问题联系起来,并提出作为一个猜想,NCTR 将有限深度 Transformer 推向这些问题集中的动态状态。 NCTR 提示还会产生较高的矛盾输出(与对照相比,$+34$-$56$ 个百分点),这表明对于理解自我参照故障模式具有实际意义。