论文

通过有原则的样本选择实现高效的 LLM 退火

Towards Efficient LLMs Annealing with Principled Sample Selection

模型训练合成数据

摘要

退火阶段是 LLM 预训练 中的关键收敛阶段,最终决定最终模型的质量。然而,在此阶段有效选择训练数据仍然是一个关键挑战。当前的策略依赖于经验启发法,例如域过滤或上下文扩展,缺乏优化理论的原则基础。在这项工作中,我们通过损失景观的光谱几何透镜来表征退火阶段。我们认为最佳收敛需要梯度更新以满足不同特征方向的异构约束。基于这一见解,我们将数据选择制定为满足这些方向约束的问题。为此,我们提出了 DiReCT(定向约束训练),这是一种新颖的框架,它将退火阶段的样本选择重新表述为约束优化问题。通过根据 Hessian 的谱特性对每个样本梯度施加明确的方向约束,DiReCT 可以识别与最佳曲率感知下降路径对齐的样本。跨各种模型规模的大量实验表明,DiReCT 始终如一地实现了最先进的性能。对于未来的研究,代码可在 https://github.com/xuyj233/Direct 获取。