论文
逐层表示动力学:跨嵌入器和基础的实证研究 LLM
Layer-wise Representation Dynamics: An Empirical Investigation Across Embedders and Base LLMs
摘要
隐藏状态在现代语言模型的各个层中发生了很大的变化,但大多数分层分析都集中在这种变化的一个方面。我们提出了分层表示动力学(LRD),这是一个具有三个分层测量系列的框架:用于全局子空间运动的 Frenet(格拉斯曼速度和曲率)、用于局部最近邻保留的邻域保留分数(NRS)以及用于与最终层对齐的图过滤互信息(GFMI)。将 LRD 应用于 30 个 MTEB 任务上的 31 个模型(基于编码器和基于解码器的嵌入器,加上基础 LLM)揭示了架构和任务级别的差异,这些差异仅从最终层表示中并不明显。然后,我们将 LRD 用于两个应用:无标签模型选择和推理时间层剪枝。对于选择,所有三个模型级分数都与下游 MTEB 性能正相关,其中端到端子空间位移 (d_{0,L}) 最强,并且相同的方向在较小的基础 LLM MMLU 面板上成立。对于修剪,GFMI 是唯一在 15% 和 20% 预算下击败随机规则的测量引导规则,并且在每个预算下都有最佳的中值变化。 Frenet仅在最轻的预算下有效,而NRS不会从模型选择转移到剪枝。这些结果表明,分层结构为解释和部署决策提供了信号。