论文

动力系统分析揭示大语言模型中的功能状态

Dynamical Systems Analysis Reveals Functional Regimes in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型通过高维内部动力学执行文本生成,但这些动力学的时间组织仍知之甚少。大多数可解释性方法强调静态表示或因果干预,时间结构在很大程度上未被探索。借鉴神经科学——时间整合与亚稳性是神经组织的核心标志——我们将这些概念适配到 transformer 模型,并讨论一种从自回归生成期间的激活时间序列计算的复合动力学指标。我们在 GPT-2-medium 上于五种条件下评估该指标:结构化推理、强制重复、高温噪声采样、注意力头剪枝与权重噪声注入。结构化推理相对重复、噪声与扰动状态始终呈现更高的指标值,单因素方差分析确认差异具有统计显著性,关键比较中效应量很大。这些结果对层选择、通道子采样与随机种子稳健。我们的发现表明,神经科学启发的动力学指标能够可靠刻画大语言模型在不同功能状态间计算组织的差异。我们强调,所提指标捕捉的是形式动力学属性,并不意味着主观体验。

动力系统分析揭示大语言模型中的功能状态
图3:展示 Ψ ′ \Psi^{\prime} 系统级性质的鲁棒性分析。(a) 层子集分析:仅由早期层(blocks 1、4)、仅由晚期层(blocks 7、10)或由全部层组合计算的 Ψ ′ \Psi^{\prime}。各条件的定性排序在所有子集上保持稳定,其中晚期层记录在结构化推理方面显示出最清晰的分离。(b) 通道子采样分析:在总共 128 个通道中,分别以 25%(32 个通道)与 50%(64 个通道)随机采样的通道子集计算 Ψ ′ \Psi^{\prime},并跨三个独立随机种子进行。均值与误差棒(跨种子的标准差)证明了随机通道削减下的稳定性。(c) 多种子一致性:跨五个独立随机种子、由 50% 通道子样本计算的 Ψ ′ \Psi^{\prime}。单个种子的结果以浅灰色点显示,均值以深色柱显示。完整复合(intact-complex)条件与其他条件之间的一致分离在所有种子上均得以保持,且各功能状态下的变异性相当。这些分析共同表明,Ψ ′ \Psi^{\prime} 捕捉的是分布式的动力学性质,而不依赖于特定通道、层或测量配置。