论文
循环 GPT-BERT:小语言建模中计算的交易参数
Looped GPT-BERT: Trading Parameters for Computation in Small Language Modeling
摘要
当训练数据有限时,增加参数数量并不是提高语言模型性能的唯一方法。反复应用小参数集也可以提供类似的性能。我们在 BabyLM 2026 Strict-small 设置中研究了 Looped GPT-BERT,将 GPT-BERT 的屏蔽下一个标记和因果语言建模目标与深度参数共享相结合。我们在经过预处理的 748 万单词英语语料库上进行训练,并比较目标比率、非循环和循环架构以及循环计数。我们最终的 $4\times12$ 模型使用四个物理层进行 12 次循环遍历,并包含 1218 万个参数。 BabyLM 2026 排行榜的总体平均值为 35.42,NLP 平均值为 48.48。与公共 BabyLM 10M Strict-small GPT-2 和 GPT-BERT 基线相比,它在选定的语言和下游指标(包括 BLiMP 和 GLUE)上以更少的参数实现了可比的性能。循环消融表明,额外的循环计算可以改善训练并在选定的语言任务上保持强大的性能,而在其他任务上较差的性能可能会揭示循环设计的固有局限性:仅使用几个物理层会限制模型的表示空间。