论文
Brain-LLM 对齐跟踪训练数据,而不是类型学
Brain-LLM Alignment Tracks Training Data, Not Typology
摘要
大脑-LLM 对齐在英语中已经很成熟,但大脑的语言网络在神经解剖学上跨语言是通用的。对齐是否也可以跨语言推广?是什么控制着这种变化?我们使用来自英语、中文和法语(小王子语料库)的 112 名参与者的 fMRI 数据以及跨越英语主导、汉语主导和多语言架构的 7 个 LLM 进行了测试。我们的主要发现是,训练语言的主导地位,而不是英语的固有属性,驱动了对齐模式:一个与 LLaMA-2-7B 架构匹配的中文主导模型 (Baichuan2-7B),完全反转了梯度,与中国大脑对齐最好,与英语对齐最差。除了训练优势之外,形式类型距离与对齐退化独立地协变,语法相关大脑区域(IFG)显示出比词汇语义区域(PTL)陡峭的类型梯度$2.3\times$,并且标记化生育率占最佳编码层跨语言转变的$\sim$60%。这些结果表明,大脑-LLM 对齐中明显的“英语优势”是训练数据构成的产物,而其余的变化反映了集中在句法处理中的真正类型结构。