论文

InfoLaw:具有质量加权混合数据和重复的 大语言模型 的信息缩放定律

InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition

模型训练预训练

摘要

在 LLM 预训练中增加高质量数据的权重通常会提高性能,但在数据有限的情况下,特别是在过度训练的情况下,更强的权重增加会增加重复并可能降低性能。然而,标准缩放定律不能可靠地在混合配方或重复情况下进行推断,从而导致缩放时最佳数据配方的选择不确定。为了解决这个问题,我们引入了 InfoLaw(信息缩放法则),这是一种数据感知缩放框架,可以预测消耗的词元、模型大小、数据混合权重和重复造成的损失。关键思想是将预训练建模为信息积累,其中质量控制信息密度,而重复会导致规模相关的收益递减。我们首先在对规模、质量分布和重复级别各不相同的数据集进行训练后收集模型性能。然后我们建立信息建模,以便信息准确地预测这些模型的性能。 InfoLaw 可以预测未见过的数据配方和更大规模运行(最多 7B、425B 词元)的性能,损失平均值为 0.15%,最大绝对误差为 0.96%,并且它可以跨过度训练级别可靠地进行推断,从而在不同的计算预算下实现高效的数据配方选择。