论文

深度与规模在少于150M参数范围内的探索:JugnuLM-53M 与 JugnuLM-110M

Depth and Scale in the Sub-150M Regime: JugnuLM-53M vs JugnuLM-110M

模型优化小模型/轻量模型

摘要

我们将传统的少于150M参数预训练方法从53.5M参数扩展至109.7M参数,保持方法不变(Qwen3风格解码器,分组查询注意力,RoPE,SwiGLU,RMSNorm,QK-Norm以及z-loss;使用FineWeb-Edu数据集),仅改变模型结构为深而窄的23层×576隐藏单元设计。更大规模的模型在各项指标上均有提升——BLiMP从78.1提升至81.3,ARC-Easy从51.4提升至52.5,WikiText-2字节困惑度从2.04降至1.95。其中110M模型的81.3% BLiMP表现几乎与GPT-X2-125M(81.28)相当,且参数量约少12%。值得注意的是,110M模型在训练token数量更少(约8B vs 12B)的情况下达到此性能,因此性能提升归因于模型容量和深度,而非数据量增加。两个模型均采用传统设计,本报告为一次纯净的规模扩展控制实验,是该参数范围下消融研究的基准运行(R0)。后续消融实验依次包括:值残差(R1)和Muon优化器(R2)使ARC-Easy提升累计+3.6(52.5→56.1),在BLiMP表现几乎持平,因此保留;多样数据混合(R3)和两种logit蒸馏设置(R4a/R4b)未被保留——属于诚实的负向实验。R3表明ARC-Easy表现与FineWeb-Edu的教育内容过滤有关,而非原始数据多样性;从1.7B教师模型蒸馏可达到领先水平的ARC-Easy(56.99,匹配GPT-X2-125M),但需以更高的困惑度为代价,若降低蒸馏强度则效果消失,因此R2仍为最优保留方案。