论文

监督 微调 错误响应后激活表示的线性可分离性:大语言模型 中综合不诚实的研究

Linear Separability of Activation Representations after Supervised Fine-Tuning on Incorrect Responses: A Study of Synthetic Dishonesty in Large Language Models

模型评测模型行为与机制分析

摘要

当语言模型经过微调以产生系统性错误响应时,这种训练是否会在其内部激活中留下结构化的、线性可恢复的痕迹?我们使用五个涵盖 1.4 至 90 亿个参数的 Transformer 架构在受控模型生物环境中研究这个问题。对于每个模型,“诚实”和“不诚实”的 LoRA 微调变体是使用相同的问题分布构建的,但正确答案与看似合理但不正确的答案不同。在五种架构中的四种中,线性探针在前几层中达到了接近上限的可分离性(AUC >= 0.9997)。对于四个模型,这种可分离性从 TruthfulQA 转移到了保留的 MMLU 主题,但对于 Pythia-1.4B 来说,这种分离性要小得多。六种几何分析揭示了表示结构中的建筑二分法。对照实验进一步表明,LoRA 微调 本身留下了强烈的激活指纹,该指纹在很大程度上与诚实相关信号分离,与 微调 数据内容无关。两个补充实验验证了这些发现:所确定的方向很难转移到释义问题,AUC 接近机会,并且规范校准的激活转向没有提供生成中因果作用的可靠证据,部分原因是更强的干预破坏了输出的流畅性。这些结果描述了监督 微调 在激活空间中引起的不正确反应,同时澄清了解释和因果意义的重要限制。