论文
动力系统分析揭示大语言模型中的功能状态
Dynamical Systems Analysis Reveals Functional Regimes in Large Language Models
摘要
大语言模型通过高维内部动力学执行文本生成,但这些动力学的时间组织仍知之甚少。大多数可解释性方法强调静态表示或因果干预,时间结构在很大程度上未被探索。借鉴神经科学——时间整合与亚稳性是神经组织的核心标志——我们将这些概念适配到 transformer 模型,并讨论一种从自回归生成期间的激活时间序列计算的复合动力学指标。我们在 GPT-2-medium 上于五种条件下评估该指标:结构化推理、强制重复、高温噪声采样、注意力头剪枝与权重噪声注入。结构化推理相对重复、噪声与扰动状态始终呈现更高的指标值,单因素方差分析确认差异具有统计显著性,关键比较中效应量很大。这些结果对层选择、通道子采样与随机种子稳健。我们的发现表明,神经科学启发的动力学指标能够可靠刻画大语言模型在不同功能状态间计算组织的差异。我们强调,所提指标捕捉的是形式动力学属性,并不意味着主观体验。
