论文

后训练 是(大规模)监督学习

Post-training is (Massive) Supervised Learning

模型训练监督微调与指令调优

摘要

流行的 LLM 训练范例已经发展为依赖于由 SFT 和 RL 组成的大规模 后训练 阶段。在这篇立场文件中,我们认为这种方法有效地标志着 BERT 时代“预训练然后微调”方法的回归,明确地根据所需的行为和评估模型的具体基准来定制模型。我们首先回顾 LLM 的历史,描述 LLM 演变的不同阶段。我们认为,当前的情况与 LLM 的早期非常相似,其中任务性能很大程度上依赖于模型与分布数据集的拟合。为了凭经验证明这一点,我们通过 微调 将预先训练的模型与随机初始化的模型进行比较,这两种模型都是现代推理数据集的变体,并在竞争性数学和代码基准上对其进行评估。我们证明,从头开始进行后训练的模型可以产生非常出色的性能。我们的研究结果表明,当前的 后训练 方法主要充当分布拟合机制。最后,我们假设开发通用模型和系统需要超越预定义行为的广泛 后训练,而是转向模型“学习如何学习”的训练程序。