论文
NebulaExp-8B:经全规模消融研究的实证后训练管线
NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research
摘要
后训练对齐决定大语言模型的推理与人类偏好遵循能力——但多数既有工作隐藏详细的数据构建、过滤规则与训练配方——阻碍社区可复现性与轻量模型优化。本工作提出NebulaExp——建立在Qwen3-8B-base上的全透明、消融驱动后训练管线——覆盖两个正交模型分支:通用instruct模型与复杂推理专门模型。我们策展384万多源SFT样本的原始语料与20万可验证RL候选池——设计端到端数据处理栈:响应蒸馏、多维交叉验证过滤、细粒度难度分级、任务分类与多样性感知采样。Instruct分支:三阶段优化的监督微调方法NebulaExp-Ins-SFT把平均基准分从Qwen3-8B-nothink的55.01基线提升到60.99;GRPO强化学习进一步把平均分提到61.85。Reasoning分支:中等难度GRPO RL把平均推理分从73.88提升到75.17。为解决RL对任务验证器的依赖——我们系统研究单教师与多教师OPD(MOPD):仅用4K指令遵循样本即在IFEval上超RL基线3.26分、总平均增益+4.43;MOPD融合四领域专家教师仅用1万样本——较基座提升平均4.18。本报告提供8B规模LLM完全可复现的实证后训练配方——并全面剖析指令遵循、数学推理、代码生成与通用知识间的能力权衡。
