论文

从流行文本记忆推断 大语言模型 的大小

Inferring the Size of Large Language Models From Popular Text Memorization

模型评测模型能力评测

摘要

最广泛使用的 大语言模型 (LLM) 的参数计数通常被其开发人员隐瞒,从而使模型大小(解释功能和成本的主要参考点)基本上未被公开。我们提出了一种黑盒方法,仅从生成的文本输出中推断 LLM 大小的保守下限,除了提交文本片段和观察下一个标记预测的能力之外,不需要任何其他操作。我们的方法基于一个关键的观察:流行的、广泛流传的文本——例如古典文学、宗教文本和基础文档——几乎存在于每个大型预训练语料库中,而模型在不同长度的文本片段中预测下一个单词的准确程度是其记忆量的可靠信号,而这从根本上受到其总参数计数的限制。我们将不同文本和片段长度语料库中的记忆信号聚合为每个模型的单个精度配置文件向量,并在其之上构建两种互补的推理方法:确定两个模型中哪一个更大的成对统计测试,以及通过主成分分析(PCA)从这些向量中提取一维潜在索引的缩放律估计器,以将聚合信号映射到参数计数。两种方法都经过一系列广泛的开放权重模型的验证,都能产生准确可靠的下限。当应用于流行的封闭权重模型时,我们的框架恢复了内部产品层次结构,并揭示了行业扩展策略的明显差异:虽然一些开发人员产生了显着更高的界限,表明大代参数增长,但其他开发人员在严格的参数上限下运行,这表明即使在严格的 API 限制下也可以系统地探索隐藏的设计选择。