论文

LLM能力下降时,表示有效秩也可能升高

When Rank Rises as LLMs Degrade

模型评测模型训练AI 基础设施监督微调与指令调优可观测性模型行为与机制分析

摘要

训练后适应非固定环境中的语言模型。从业者使用 RankMe 和相关频谱统计数据来监控表征的健康状况,通常假设当表征降级时排名会下降。我们证明这种假设对于LLM培训后是不安全的。在对具有四种降解模式和三种种子的 Qwen3-0.6B 进行的对照研究中,数据重复使保留损失相对于健康情况恶化了 75%,同时增加了原始和中心 RankMe;后者变化了 13.5 倍的合并标准差。协方差有效排名上升到其健康值的近两倍。这种故障是光谱色散而不是崩溃,因此单方面的监视器将最差的检查点评为最健康的检查点。相比之下,学习率配置错误会降低中心 RankMe 和 k95,而非中心 RankMe 在种子之间不一致。因此,方向是状态统计量对的属性,不能仅通过重新校准来确定。我们还区分了两个经常混淆的统计数据:RankMe 标准化奇异值,而协方差有效排名标准化 特征值。在预训练模型中的原始中间层状态上,大量激活将后者固定在 d 维外接近 1,而 RankMe 保留可用范围。然后,我们使用单独的校准和测试数据测试双面多通道顺序监视器。在预先注册的共享前缀、留一种子评估中,它会在分叉后 10 到 60 步的每个折叠中检测所有三种损坏状态,并通过发射方向将分散性与降级损坏分开。然而,它永远不会先于保留的探针丢失,并且用两个种子进行校准会对保留的健康种子产生错误警报。频谱监测可以诊断故障状态,但它不会在保留损失之前发出警告,并且有效性声明需要保留健康数据。