论文
LLM 预训练的不稳定:并不总是有帮助。多种语言的调查
Instability of LLM Pre-Pretraining: It Doesn't Always Help. An Investigation on Multiple Languages
摘要
据报道,在人工语言上对 LLM 进行预训练(“预预训练”)是一种可以将词元效率提高 33% 的技术,即节省达到特定性能所需的高达 33% 的训练词元。我们使用两种不同的分词器和不同的模型大小,在跨四个语系的更多自然语言上验证了英语的先前结果。我们还将观察到的标记效率的增益(或损失)与语言的量化语言属性联系起来,例如句子长度、形态丰富度和依存句法树的特征(树深度、子代数量、交叉依存关系数量)。我们的实证结果表明,报告的增益在很大程度上取决于实验设置和随机种子的选择,尽管我们可以通过使用 Llama 分词器对大多数所检查语言的小型模型进行 128-Dyck 预训练来确认稳定增益的趋势。总的来说,我们认为至少应该对一部分实验进行多次训练,以避免社区采用不稳定的方法。