论文
用语言模型中的稀疏特征解释大脑对语言的反应
Interpreting Brain Responses to Language with Sparse Features from Language Models
摘要
认知神经科学的一个中心目标是表征人类语言皮层所代表的特征。人工语言模型 (LM) 已成为应对这一挑战的强大工具,但有关生物和人工表征的研究经常因将一个黑匣子与另一个黑匣子相关而受到批评。目前的工作介绍了增强稀疏编码模型,这是一种编码框架,它用分层组织的稀疏自动编码器 (SAE) 特征取代密集的 LM 隐藏状态,同时明确将意外作为预测因子。使用这种方法,我们(i)产生神经反应的解释,并(ii)测试模型-大脑对齐是否反映了 LM 表征的主要或特殊变化。使用由 8 名参与者聆听 200 个不同语言的句子组成的高场 7T fMRI 数据集,我们首先通过恢复之前对体素群体的解释来验证我们的建模框架,这些解释调整为处理难度和含义抽象性。然后,我们解释以前未表征(但可靠)的体素群体,并发现它已调整为与人相关的内容。接下来,我们证明额颞人类语言网络是通过其组成区域的一组共同特征来预测的,但发现即使在没有基于 LM 的特征的情况下,仅用惊讶就可以相对很好地解释额叶区域。最后,我们证明语言处理过程中的大脑反应不仅仅可以通过任意一组 LM 特征来预测。相反,大脑反应最好由那些倾向于捕获 LM 表示中编码的最一般信息的特征来解释,这表明大脑和 LM 语言表示之间存在非平凡的对应关系。