论文
对监督微调的机制性考察
A Mechanistic Investigation of Supervised Fine Tuning
摘要
大语言模型在监督微调(SFT)前后隐藏激活之间的余弦相似度仍然非常高。这乍看之下表明SFT几乎没有扰动模型的激活几何结构。然而,将两组激活投影到在基座模型上预训练的稀疏自编码器(SAE)中可以发现,底层的稀疏潜变量显著发散。我们引入一种新颖的研究流水线,将这些预训练的SAE用作高分辨率诊断工具,从机制层面探究这种表征发散的驱动因素。通过我们的分析流水线,我们发现在监督微调中被系统性改变的精确语义特征呈现出任务特定与层级特定的分布。我们还识别出安全对齐特有的逐层更新模式。与本工作相关的所有代码、实验脚本与分析文件已在以下地址公开:https://github.com/ruhzi/sae-investigation。
