论文

ufakzeka-1:从头开始构建和评估 151M 参数的土耳其语言模型

ufakzeka-1: Building and Evaluating a 151M-Parameter Turkish Language Model from Scratch

模型训练预训练

摘要

我们描述了 ufakzeka-1,这是一个 151M 参数(182M 带嵌入)的仅解码器土耳其语言模型,在 13.5B 开放许可文本词元和针对聊天进行调整的指令上从头开始预训练,云 GPU、API 和笔记本时间的总成本约为 286 美元。贡献不是模型的能力(这是这种规模的模型所期望拥有的),而是构建和测量模型的记录:每个单词 1.77 个标记的土耳其字节级标记器、三阶段预训练计划、公开许可和生成数据的训练后混合、发布门评估电池、对 5,508 个对话的规则检查扫描、判断对话和手动测试,所有这些都带有训练数据中的提示,通过数据构建内部的净化以及我们在每次构建之前运行的签入不变脚本来强制执行。我们报告了三个发现,我们相信这些发现可以转移到其他小模型的工作中:一个安全门,已经用根据自己的问题编写的训练数据进行了“修复”,读数为 64/64,而真实的数字为 34/64;训练种子方差与我们尝试的每个食谱的分布一样大,因此这种规模的单种子比较没有提供任何信息;数据轮只修复了数据中缺少的内容,而长上下文和多轮算术上的身份跟踪并没有跨越我们尝试过的任何数据更改,我们将其视为模型大小的限制而不是数据中的间隙,读取下一个更大的模型将进行测试。权重、数据配方、评估代码和支出账本均在 Apache-2.0 下发布。