论文
Subword Segmental BabyLM:学习标记以实现样本高效的预训练
Subword Segmental BabyLMs: Learning to Tokenise for Sample-Efficient Pretraining
摘要
在标准 LM 训练流程中,子词标记化被用作预处理步骤。子词分段语言建模是一种替代范式,在训练过程中学习标记化,使模型能够发现优化其训练目标的子词单元。在本文中,我们提交了 2026 BabyLM 挑战赛的参赛作品,为此我们开发了两种新的子词分段 LM:SubSegGPT 和 SubSegDeBERTa。 SubSegGPT 是一种仅解码器模型,可在自回归预训练期间学习标记化。 SubSegDeBERTa 是一种基于编码器的模型,可共同学习生成和标记屏蔽词。我们针对严格赛道和严格小赛道进行训练。我们向 Strict 提交的顶级作品是 SubSegDeBERTa,它在零样本评估方面取得了显着的成果。我们向 Strict-small 提交的最多的内容是 SubSegGPT,它的性能优于基于标记化的基线。我们的结果表明,可学习的子词标记化可以提高 BabyLM 预训练的样本效率。我们分析了模型的子词学习动态,发现标记化逐渐收敛于平衡形态对齐和细粒度分割的子词单元。