论文

当探测精度饱和时,脆弱性得到解决:LLM 预训练 分析的补充指标

When Probing Accuracy Saturates, Fragility Resolves: A Complementary Metric for LLM Pre-Training Analysis

模型评测模型行为与机制分析

摘要

当隐藏状态的分类器达到高精度时,标准线性探测声明属性“编码”。该协议在快照上运行良好,但突破了 预训练,探测精度在前几千步内饱和,使得大部分训练对仪器不可见。我们引入了脆弱性,这是一种互补的每层指标,定义为探测精度崩溃的激活噪声水平。脆弱性对可分离性的边际和表示的冗余都很敏感,这两者在精度达到稳定水平后很长一段时间内都在不断发展。应用于开放检查点语言模型时,脆弱性可以恢复仅靠准确性无法看到的结构。我们的兴趣道德化表征分阶段出现,首先对道德负载词进行高精度检测,然后进行组合编码。因为探测准确性本身跟踪数据集在词汇上的可分离程度,所以我们通过显示它在不共享对比标记的构造类型之间传输来直接建立组合编码。当探究的准确性返回一个平坦的答案时,脆弱性返回一个结构化的答案。原始临界噪声也显示出层深梯度,但我们识别并纠正了一个混淆,据我们所知,该混淆在噪声注入探测中尚未记录。也就是说,更深的层具有更大的激活,因此固定的绝对噪声使它们看起来比实际更强大。每层重新缩放会消除大部分梯度,而层内比较仍然有效,并且仍然通过脆弱性来分离相同精度的语料库。我们建议使用 RMS 归一化临界噪声进行跨层声明,使用原始临界噪声进行层内比较。