论文
后训练 监督科学 微调
Post-Training Science for Supervised Fine-Tuning
摘要
每个受监督的 微调 运行都会强制执行相同的决策链,例如学习率、批量大小、LoRA 或完整的 微调、多少个 epoch、哪个优化器以及为模型提供哪些数据。对于每个新模型和数据集,通常都会从头开始重新发现其中的每一个。在这里,我们使用一种工具来测量它们:一次改变一个杠杆的扫描,跨越两个系列(Qwen3 和 Llama)的密集和混合专家模型,在四个现实世界客户 SFT 数据集上,适用于 LoRA 和完整的 微调。这些数据集提供了一个受控测试平台:每个任务都带有与客户一起构建的评估,其训练数据由迭代监督 微调 生成,该迭代监督模型输出直至通过评估,因此监督目标是内部一致的,我们报告的任务判断是构建数据要满足的标准。我们询问最佳学习率和批量大小如何随模型规模、族和数据变化,以及一种选择规则是否在它们之间转移; LoRA 与完整的 微调 进行什么交易,以及它的等级和 alpha 如何设置适配器可以学习的内容;验证损失(或其他指标,例如损失景观平坦度)是否忠实地对下游质量进行排名; 后训练 在通过专家混合扩展至 235B 参数的模型阶梯上是否会随着模型大小和数据量的增加而扩大规模;在一般指令遵循被侵蚀之前要训练多少个时期;以及几何感知优化器是否在 AdamW 的基础上有所改进。每项建议都与其不确定性的度量相匹配。