论文

解耦微调大语言模型中的内部表征变化与因果重要性

Decoupling Internal Representational Changes and Causal Importance in Fine-Tuned Large Language Models

模型评测模型行为与机制分析

摘要

微调已成为将LLM适配到各类下游任务的普遍方法,但它如何重塑模型内部机制仍知之甚少。为此,我们研究微调如何改变LLM的内部表征(包括注意力模式和逐层激活),并考察这些变化是否与EAP识别出的、驱动任务表现的任务相关组件(如注意力头和logit级激活)相关联。我们发现,EAP识别的组件集中于特定层,表明模型内化任务行为存在一定程度的功能局域化。值得注意的是,这些组件在各层的分布与微调中表征变化最剧烈的层基本不相关。此外,我们观察到,不同任务间EAP识别组件的重叠并不必然转化为跨任务性能迁移——当两个任务性质不同(如分类与生成任务)时尤其如此。更具体地说,当两个任务的EAP识别组件高度重叠时,在一个任务上微调可能导致另一任务性能退化。

解耦微调大语言模型中的内部表征变化与因果重要性:论文配图
图 1:EAP 为情感分类(上)、问答(中)和机器翻译(下)识别出的任务特定组件(如注意力头、MLP)示例。符号说明见附录 A。