论文

可解码但不可分离:训练数据粒度决定大语言模型的参数模块化

Decodable But Not Detachable: Training Data Granularity Determines Parametric Modularity in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型是否包含领域特定的参数外壳:集中的、因果上必要的神经元群体,移除它们会选择性损害目标领域而不伤及其他领域?我们在两种领域粒度、三个模型家族(1.5B至7B参数)和八个领域中应用统一的因果方法学。在学科层面,939,008个FFN神经元中没有一个超过60%的领域选择性,因果损伤矩阵是平坦的,尽管领域身份可被线性解码且准确率超过85%。在语言与模态层面,0.65-1.14%的神经元超过60%选择性,损伤矩阵近乎完美对角(比值最高达595:1),外壳神经元集合基本不相交(IoU<0.003)。掩蔽代码选择性神经元使所有模型的数学推理准确率下降16-24个百分点;掩蔽西班牙语或中文神经元则使其降到随机水平或以下。外壳强度随规模单调增强,且外壳在空间上交错分布,其模式排除了组级选择性量化。参数外壳当且仅当训练数据在token层面模块化之处形成。

可解码但不可分离:训练数据粒度决定大语言模型的参数模块化:论文配图
图2:三个模型在ρ=0.02\rho=0.02下的语言级损伤矩阵(相对计数匹配随机基线的净dNLL)。行:被消融的shell。列:被评估的领域。对角线均值为1.82、2.19和3.37 nats;非对角线均值为−0.012-0.012、−0.060-0.060和+0.006+0.006 nats。