论文

跟踪 LLM 中的计算密度

Tracing Computation Density in LLMs

模型评测模型行为与机制分析

摘要

基于 Transformer 的 大语言模型 (LLM) 由数十亿个参数组成,这些参数排列在深度和广度的计算图中,但尚不清楚它们是否充分利用了所有输入的能力。我们引入 s-Trace 方法来有效地估计大小为 s 的子图,该子图近似于完整模型的输出。通过这种方法,我们发现各种 LLM 中的计算被组织为两个不同的阶段。主要由早期层节点组成的小子图可以重建完整模型输出分布的头部。添加更多节点(主要位于后面的层并且越来越多地由注意力头组成)会导致近似完整输出分布的增量细化。此外,我们发现每个输入所需的计算量与模型不确定性相关,并且稀疏子图编码浅层统计数据,例如一元频率。总的来说,我们的结果表明有效的 LLM 计算中存在一致的模块化组织,稀疏的早期层核心提供了粗略的预测,并通过后面层中更密集的计算进一步细化。