论文

L20-Edu-135M:数据高效小语言建模的可审计单 GPU 研究

L20-Edu-135M: An Auditable Single-GPU Study of Data-Efficient Small Language Modeling

模型优化小模型/轻量模型

摘要

小语言模型的服务成本低廉,并且在本地硬件上可行,但强大的公共 135M 级系统通常在大型集群上使用数千亿到数万亿个词元进行训练。我们研究了一种资源严重受限的机制:在一个 NVIDIA L20 GPU 上执行的完整 134.5M 参数语言模型管道。发布的检查点 L20-Edu-135M 接收大约 13B 个预训练词元:10B 个 FineWeb-Edu 词元,然后是 3B 个教育、数学、代码和推理混合词元。我们记录了架构、数据门、跨源 MinHash/LSH 近重复数据删除、分段重复数据删除、基准重叠删除、吞吐量优化、带权重插值的监督 微调 (SFT) 以及 GSM8K 上可验证奖励 (RLVR) 的强化学习。在自运行的零样本六任务测试工具中,L20-Edu-135M 的平均得分为 0.4150。它落后于 SmolLM-135M (0.4767) 和 SmolLM2-135M (0.4917),但其平均值是 SmolLM-135M 的 87.1%,而其名义词元数量是 SmolLM-135M 的 2.17%。该比率是描述性的,而不是统计等效性或受控缩放定律的证据。该模型在同一Harness下超过了多个较旧的 100M-160M 公共基线。直接 GRPO 式 RLVR 将 GSM8K 精确匹配精度从 1.82% 降低到 1.59%(192 个词元完成)和 1.21%(320 个词元完成)。这些单次运行结果确定了具体的故障模式,而不是建立 RLVR 的一般下限。该贡献是一个可审计的资源有限的案例研究,而不是最先进的主张。