论文预训练好不代表SFT后仍好:完整训练链的检查点质量Good Pretraining, Bad SFT: Checkpoint Quality Across the Training StackSohir Maskey , Philipp Scholl , Jonas Knupp , Pit Neitemeier , Sascha Wirges·来源日期:2026.09.08模型评测模型行为与机制分析收藏摘要原文译文语言模型检查点通常通过预训练损失或基准分数来选择,假设得分最高的检查点仍将是后续训练的最佳起点。我们证明,这种假设在完整的 30B 专家混合训练管道中可能会失败。在完整的下游训练堆栈之后表现更好的检查点也具有更高的解决方案密度,即在局部权重扰动下保留下游性能。