论文
点火指数:测量语言模型的全局工作空间动态
The Ignition Index: Measuring Global Workspace Dynamics in Language Models
摘要
我们引入了Ignition Index(I),这是一种验证过的标量指标,用于操作化全局工作区理论(GWT)中所有或全部的点火预测。该指标将每层线性探针准确性与输入信号强度关联起来,并提取斜率参数β-hat:高值表示突变式、点火式的转换;低值表示渐进式的积累。在11个模型,跨越五个架构家族,随机标签控制组展示了9.6倍的真语言结构选择性(p < 0.001,Mann-Whitney U-test)。我们发现:(1) 前馈变压器超越SSMs 89%(p < 1e-13,Cohen's d = 0.52),Mamba表现出与全局广播缺失一致的近乎线性的轮廓。(2) Huginn-3.5B在迭代轴上比其深度轴高出2.12倍,表明循环架构在重复维度上表现出了工作区式的转换。(3) Pythia-410M在训练步数256处检测到一个PELT检测到的阶段变化(+67%),预示着诱导头的形成。(4) 与模型规模和信号强度相关的点火假说未被证实,暗示变压器架构可能饱和可用的点火机制。Ignition Index为GWT动态预测与机械可解释性之间的第一个验证性的定量桥梁提供了9.6倍的测量选择性和未在规模文献中表征的架构级可区分性。代码:https://github.com/saman-rahbar/ignition-index
