论文
ArXiv-to-Model:科学语言模型训练的实践研究
ArXiv-to-Model: A Practical Study of Scientific LM Training
摘要
尽管前沿大语言模型展现出强大的推理与数学能力,从原始语料训练领域专用科学语言模型的实际过程仍缺乏系统记录。本工作给出一个详细案例研究:直接从覆盖数学、计算机科学与理论物理的原始arXiv LaTeX源码训练一个1.36B参数的科学语言模型。我们描述了一条端到端流水线,涵盖元数据过滤、归档校验、LaTeX抽取、文本规范化、领域感知分词,以及在受限算力(2块A100 GPU)下的稠密transformer训练。通过24次实验运行,我们分析训练稳定性、扩展行为、数据产出损耗与基础设施瓶颈。发现突显了预处理决策如何显著影响可用词元量、分词如何影响符号稳定性,以及存储与I/O约束如何能比肩算力成为限制因素。我们进一步分析收敛动态,并展示数据充足情形(52B预训练词元)下的稳定训练行为。本工作不提出新架构,而是对从零训练小型科学语言模型给出立足工程、过程透明的记录。我们希望这些洞见能帮助在中等算力预算下寻求构建领域专用模型的研究者。
