论文
大语言模型 的光谱特征
Spectral Signatures of Large Language Models
摘要
公开可用的 大语言模型 (LLM) 存储库的快速增长给大规模系统管理和量化带来了重大挑战,例如模型谱系追踪、许可和评估。然而,特定于任务的基准对于这种设置来说是不够的,因为 LLM 在架构、规模和训练程序方面差异很大。为了应对这一挑战,我们采用基于谱形状的指标来管理和量化基于重尾自正则化理论的 LLM。我们的方法使用权重经验谱密度的形状信息作为每个模型的紧凑谱特征。该签名捕获预训练模型的内在属性,并在 后训练 期间保持稳健,使其适合模型级分析。此外,该指标无需数据、计算效率高且具有尺度不变性,可在实践中进行大规模分析。此外,我们还策划了一个由主要开源 LLM 系列组成的大型且多样化的模型语料库,并使用它来系统地对模型和下游任务的光谱和非光谱指标进行基准测试。我们表明,我们的光谱签名支持模型谱系的跟踪、相似模型的无监督聚类以及模型性能的量化。总体而言,所提出的光谱特征为 LLM 的广泛性能趋势提供了有意义的代理,从而实现了大型模型集合的高效组织、比较和分析。