论文
大语言模型开发中存在“秘方”吗?
Is there "Secret Sauce'' in Large Language Model Development?
摘要
领先的大语言模型(LLM)开发者是否拥有专有的“秘方”,还是LLM的性能主要由扩大算力驱动?我们利用2022年至2025年间发布的809个模型的训练与基准数据,估计了带有发布日期和开发者固定效应的缩放律回归。我们发现存在开发者特定效率优势的明确证据,但其重要性取决于模型在性能分布中所处的位置。在前沿,80-90%的性能差异可由更高的训练算力解释,这意味着驱动前沿进步的是规模而非专有技术。然而,在远离前沿之处,专有技术与共享的算法进步大幅降低了达到固定能力阈值所需的算力。一些公司能够以更高的效率系统性地训练出更小的模型。引人注目的是,我们还发现公司内部模型效率存在巨大差异:同一家公司可以训练出算力效率相差超过40倍的两个模型。我们还讨论了这些发现对AI领导地位与能力扩散的影响。
