论文
缩小规模法则:资源受限的参数效率和计算最优训练大语言模型
Scaling Down the Scaling Laws: Parameter Efficiency and Compute-Optimal Training in Resource-Constrained Large Language Models
摘要
大语言模型 (LLM) 通过增加模型大小、训练数据和计算资源,实现了显着的性能提升。然而,传统的扩展方法会产生收益递减、财务和环境成本上升以及大型工业实验室之外的研究人员的参与障碍。本综述探讨了LLM缩放理论从经验缩放定律到计算最优训练的演变,特别强调参数效率、token利用率、数据效率和资源受限环境。缩放定律的基础工作与后来对计算最优训练、数据修剪、高效架构、量化、低秩适应和面向边缘的优化的研究相结合。文献表明,从规模最大化转向更谨慎地分配参数、token、计算和硬件资源。与此同时,关于在企业级基础设施上建立的扩展原则是否可以推广到较小的模型和受限的计算环境,重要的经验、理论和方法论差距仍然存在。本综述将这些进展组织成资源高效的LLM训练的统一框架,并认为未来的进展不应仅通过模型性能来评估效率,而应通过性能、参数计数、计算成本、token分配和硬件约束之间的关系来评估效率。