论文
OpenLanguageModel:用于教育和研究的可读且可组合的小语言模型预训练
OpenLanguageModel: Readable and Composable Small-Language-Model Pretraining for Education and Research
摘要
OpenLanguageModel (OLM) 是一个开源 PyTorch 库,用于构建和预训练小语言模型,同时保持其机制可见。在 OLM 中,模型代码读起来就像架构:组件是普通模块,而 Block、Residual、Repeat 和 Parallel 描述了它们的连接方式。生成的模型可以从教学笔记本直接转移到完整的预训练运行或研究消融。 OLM 将此可读模型层连接到分词器、本地和流数据集、优化、混合精度、回调、检查点以及硬件感知 CPU、单 GPU 和单节点多 GPU 执行。我们通过跟踪 GPT-2 从图表到代码、启动 FineWeb-Edu 训练脚本、替换一个注意力组件并让 AutoTrainer 配置可用机器来演示完整路径。该软件包包括 9 个熟悉的模型系列的 27 个预设以及从 LM 基础知识到架构研究的文档。验证显示与独立参考实现非常一致,348M 参数工作负载的四 GPU 弱扩展效率为 90.6%,紧凑的架构编辑以及积极的早期可用性结果。 OLM 已获得 MIT 许可,可通过 PyPI、GitHub 及其文档网站获取。