论文

从 大语言模型 中的失语图片命名错误配置文件恢复病变参数

Recovering Lesion Parameters from Aphasic Picture Naming Error Profiles in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 的可解释性方法描述内部状态,但不直接测试该状态是否足以产生观察到的行为。在早期的工作中,我们对 LLM 进行损伤,以在图片命名中产生错误特征,这是评估失语症的核心任务,并发现特定损伤产生的错误类似于个体中风幸存者的错误。这里我们提出一个反问题:给定一个错误轮廓,产生它的损伤参数是否可以恢复,这个反问题揭示了 Transformer 计算的什么内容? LLaVA-Vicuna 13B 中的病变通过 4,840 个配置的层索引、修改百分比和噪声西格玛进行参数化,错误概况通过七类临床分类法(正确、语义、不相关、正式、混合、新词、无响应)进行表征。我们训练了一个多任务神经网络,将误差分布映射回扰动参数。该问题承认了部分解决方案:在 10 个独立训练的逆模型中,修改百分比和噪声西格玛是可恢复的,而图层索引仅在邻域内可恢复。在反事实验证中,受恢复参数干扰的新模型实例在 81.4% 的情况下重现了目标行为。低层恢复和高反事实保真度之间的这种分离与 Transformer 层之间的功能冗余一致,这是标准可解释性方法未捕获的属性。作为分布外测试,我们将训练好的模型应用于 278 名中风幸存者的图片命名错误概况;恢复的参数具有综合症区分性,对于扰动强度最为强烈,表明泛化超出了训练分布。反事实验证为 LLM 可解释性声明提供了超越逆映射的通用框架。