论文

语言模型 微调 中的幻象转换:密度矩阵分析

Phantom Transitions in Language Model Fine-Tuning: A Density-Matrix Analysis

模型评测模型行为与机制分析

摘要

语言模型经过微调,正确的完成必须超越近乎同义词的竞争对手,但往往会悄无声息地失败。交叉熵损失单调下降,而正确的词元在模型排名中永远不会超过竞争对手。我们在两个系列的五个 Transformer 架构中研究了这一点,跨越了六倍的参数范围,在十个上下文中,这些上下文的正确和竞争完成共享大量嵌入重叠。我们构建了一个将预测分布与嵌入重叠相结合的顺序参数,作为密度矩阵,因为该分布存在于非正交基础上。它附加地分解为跟踪对正确标记的承诺的信号项和通过嵌入块如何将概率泄漏到分数中而设置的拖动项。这隔离了两种故障模式。在运动学故障中,信号保持太小并且模型永远不会提交。在结构失效中,阻力在 微调 期间恶化,因此模型随着损失的下降而呈几何级数退化。阶次参数也显示出类似于相变的急剧跳跃。我们通过在每个梯度步骤后跟踪它来测试自发对称破缺读数,并排除它。尽管词元嵌入矩阵从未改变,但 LoRA 下的跳转仍然存在。当几何体无法移动时,不可能发生几何相变,因此不连续性完全在于 softmax 读数。一些无量纲量组织了跨架构的轨迹。其中之一在完整的 微调 下的所有五个模型中都是一致的。第二个根据其批量嵌入分布将架构分为两类,并预测 LoRA 是否可以单独提交句子。作为盲测,该框架将保留架构的临界学习率预测为稍后扫描的 2.1% 以内。这些结果表征了这种近同义词机制,并且需要在外推之前重新校准。