论文

MoRFI:单调稀疏自动编码器特征识别

MoRFI: Monotonic Sparse Autoencoder Feature Identification

模型评测模型行为与机制分析

摘要

大语言模型(LLM)在预训练阶段通过下一个词元预测获得了大部分事实知识。 后训练的后续阶段经常引入参数知识之外的新事实,从而引起幻觉。虽然已经证明,对新知识的监督 微调 (SFT) 可能会加剧问题,但其潜在机制仍然知之甚少。我们进行了受控 微调 实验,重点关注闭卷 QA,并确定与这种退化相关的潜在方向。具体来说,我们在单个 QA 数据集的七个受控混合物上对 Llama 3.1 8B、Gemma 2 9B 和 Mistral 7B v03 进行微调,控制新知识的百分比和训练时期的数量。通过测量测试集上的表现,我们验证了逐步引入新知识会增加幻觉,并且随着训练时间的延长,效果会更加明显。我们利用预训练的稀疏自动编码器(SAE)来分析每个模型的各个检查点的残余流激活,并提出单调关系特征识别(MoRFI)来捕获因果相关的潜在变量。 MoRFI 过滤单调响应目标属性的受控 微调 数据混合的 SAE 特征。我们的研究结果与未知事实的暴露一致,这些事实破坏了模型沿着残差流中的一组方向检索存储的知识的能力。我们的管道可以跨不同的模型可靠地发现它们,通过单潜在干预部分恢复丢失的知识。