论文
稀疏自动编码器将大脑 LLM 对齐映射到皮质语义拓扑上
Sparse Autoencoders Map Brain-LLM Alignment onto Cortical Semantic Topography
摘要
大语言模型 (LLM) 的中间层可以最好地预测人类大脑对语言的反应,这是计算神经语言学中最有力的发现之一,但其原因在机制上仍然无法解释。我们通过将稀疏自动编码器 (SAE) 与神经编码模型的机械可解释性联系起来,将 GPT-2 XL 和 Llama-3.1-8B 分解为每层 16K-32K 可解释特征来解决这一差距。人类验证的分类法 ($κ\geq 0.74$) 显示,语义特征本身就恢复了 94% 的峰值编码性能 ($r=0.285$),大大超过了方差匹配基线 ($p<0.001$, $d=1.31$)。除了这种总体优势之外,我们还测试了一种新颖的皮质地形预测:从三个独立的神经科学程序中先验得出的五个语义子类别应该映射到不同的大脑区域。正式的收敛测试证实了这种一致性(Spearman $ρ=0.72$,$p<0.001$;超几何 $p=0.007$),证明 SAE 发现的特征以先前方法无法访问的粒度概括了已知的皮质语义组织。 SAE 功能进一步预测超出词汇控制的人类阅读时间($Δ\mathrm{logLik}=38.4$,$p<0.001$),并且探索性预测误差分析提供了初步证据,表明大脑还编码了意想不到的语义内容。结果适用于英语、汉语和法语。