论文

幂律的力量:不对称性促进组合推理

The Power of Power Law: Asymmetry Enables Compositional Reasoning

模型训练预训练

摘要

自然语言数据遵循幂律分布,大多数知识和技能出现的频率非常低。虽然普遍的直觉表明,重新加权或整理数据以实现均匀分布可能有助于模型更好地学习这些长尾技能,但我们发现了一个违反直觉的结果:在各种组合推理任务中,例如状态跟踪和多步算术,幂律分布下的训练始终优于均匀分布下的训练。为了理解这一优势,我们引入了一个极简的技能组合任务,并证明幂律分布下的学习需要的训练数据要少得多。我们的理论分析表明,幂律采样会产生有益的不对称性,从而改善病理损失情况,使模型能够首先获得数据复杂性较低的高频技能组合,这反过来又可以作为有效学习稀有长尾技能的垫脚石。我们的结果为什么构成了训练模型的有效数据分布提供了另一种视角。