论文
收敛差距:指令调整的语言模型在前向传递中稍后稳定
The Convergence Gap: Instruction-Tuned Language Models Stabilize Later in the Forward Pass
摘要
当检查点提交其下一个词元预测时,最终输出会隐藏。我们引入了收敛间隙,这是一种模型差异诊断,可以解码每一层的下一个词元分布并测量其与模型自身最终分布的距离。在本机提示机制中的六对预训练和指令调整检查点中,指令调整检查点与后来进入堆栈的最终预测仍然相去甚远。在端点匹配的原始和调整读数、无端点的相同历史检查和固定历史模板重播下,该效果仍然存在。匹配前缀干预将后期 MLP 窗口确定为最大的测试杠杆点:后期 IT 移植到 PT 主机使后期 KL 增加 +0.34 nat,而 PT 后期交换到 IT 主机则减少 -0.51 nat;匹配的随机后期扰动仅给出+0.003,而真正的后期移植物则给出+0.327。预先选定的 Gemma 案例研究为相同的后期交换提供了面向行为的合理性,但不作为基准主张。这些结果确定了 后训练 的稳健预测动力学特征:发布的指令跟踪检查点往往会稍后稳定,并且后期 MLP 计算是匹配历史下对该延迟的最强测试双向处理。