论文

基于扰动的减法映射区域可解释性(PRISM):语言模型中的命名错误分离和中风后失语症

Perturbation-based Regional Interpretability through Subtraction Mapping (PRISM): naming-error dissociations in language models and post-stroke aphasia

模型评测评测方法与指标

摘要

大语言模型 的机械解释缺乏空间解析的、可证伪的工具来测试内部组件是否专门用于不同的认知操作。我们采用减法分析(人类神经影像学的标准框架),从生物大脑到扰动的 Transformer,并将相同的逻辑并行应用于两个基底。 Brain-LLM 统一模型 (BLUM) 表明分层扰动的 LLaVA-1.6-Vicuna-13B 误差分布与失语症患者的病变模式相匹配,在此基础上,我们开发了 PRISM(通过减法映射进行基于扰动的区域可解释性)。 PRISM 映射七个临床费城命名测试类别,成对减去错误类别,并将每个扰动种子视为组分析中的主题,并沿层轴进行无阈值聚类增强。我们使用相关-差异病变-症状图谱对 213 名慢性中风后失语症患者进行了结构匹配分析,并在保留的分裂上复制两侧。这些设计在受试者维度(种子、患者)、空间维度(层、图集分割皮层)和阈值方面匹配,但对比算子不同:LLM 的受试者内误差比例差异,皮层的受试者间相关性差异。两个基底都恢复了强大的有利于音素的解离,即深层簇和额叶-侧裂皮层簇,两者都在复制;语义偏好方向是两者的一致符号但不显着的趋势。因此,PRISM 为 Transformer 语言模型中的功能专业化声明提供了可证伪的、空间解析的测试。验证性投资回报率水平干预(PRISM 第 3 阶段)许可最强的因果机制主张留待后续工作。