论文
训练更智能,而不是更长:记忆引导数据重用,实现高效 LLM 训练
Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training
摘要
大语言模型的训练范式从传统的one-pass训练转变为多epoch训练,合理复用有限的高质量数据可以提高模型性能和样本效率。同时,过度重复会带来过度拟合和收益递减的风险。因此,确定何时以及如何有效地重用数据成为一个自然但尚未充分探索的问题。通过对从损失保留动态和下游评估分数中得出的模型“记忆窗口”信号的新颖观察,我们提出了“记忆引导数据重用”,这是一种自适应确定何时以及如何重用数据的训练范式,从而能够对训练纪元的数量和数据重播的安排做出原则性决策。我们的初步实验揭示了一致的记忆驱动机制:随着重复次数的增加,表现不断提高,远远超出了当前的实践(例如,通常引用的四轮限制)。虽然完整的调度程序仍然是未来的工作,但这些见解为记忆感知训练计划奠定了基础,有助于确定重用预算并朝着更智能地而不是用有限的高质量数据进行更长时间的训练 LLM 迈进。