论文

说谎只是一个阶段:语言模型缩放中隐藏的对齐转变

Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling

模型评测模型行为与机制分析

摘要

缩放定律预测计算损失,但不能预测能力如何相互作用。我们测量了来自 16 个系列的 63 个基本模型的推理与真实性之间的耦合,并发现损失曲线不可见的状态变化:低于依赖于系列的临界尺度 N_c,能力反相关(r = -0.989,p = 4 x 10^{-5} 非参数排列测试);在它上面,他们合作。 N_c ~ 3.5B 参数 [2.9B, 13.4B](引导 95% CI),但模型大小并不是决定相位的唯一变量。架构、数据管理和训练方法各自独立地转变 N_c:管理训练消除了 Qwen 代之间的耦合度下降(匹配规模下为 0.025 到 0.830),通过 蒸馏 和架构创新,4B 的 Gemma-4 实现了 0.871 的耦合,这是 13B+ 标准训练模型的特征,而 1B 的 Phi 仅通过数据管理就可以匹配 10B 的网络训练耦合。宽度归一化消除了所有测试系列的反相关性,支持输出投影瓶颈。在内部,40 个模型中有 38 个显示零竞争注意力头。稀疏回归 ODE 以 5.6% 的误差对保留的 Llama-2 进行交叉预测。该诊断不需要模型内部结构——只需要整个模型系列的公共基准分数。合作制度延伸到前沿(r = +0.72,34 个模型,10 个实验室)。概念验证干预证实了瓶颈是可利用的:在识别层添加单个真实方向向量可以在零再训练的情况下纠正税收阶段 60% 的错位输出——这是一种不需要权重修改的外科手术式每次推理校正。代码、数据、适用于任何开放权重模型的开源转向 CLI 以及用于阶段诊断的交互式仪表板已发布:https://zehenlabs.com/cape/。