论文

使用递归 Transformer 从有限数据中获取更多信息

Squeezing More from Limited Data with Recursive Transformers

模型架构递归架构

摘要

有限数据下的 预训练 需要与 Web 规模语言建模不同的缩放视图。在数据预算固定但计算相对丰富的情况下,增加参数数量只能帮助达到最佳规模;超过这个点,模型就会过度拟合,泛化能力也会恶化。我们研究了 10M-100M 字 预训练 预算、两个语料库和多个下游评估的这种行为,发现最佳大小在很大程度上取决于数据预算和下游目标。我们认为标准 Transformer 在此设置下的缩放效果很差,因为嵌入消耗了参数预算的很大一部分,并且每个词元的计算与表示能力相关。为了解决这种耦合问题,我们研究了递归 Transformer,在深度范围内重用共享块来进行缩放计算,并结合分解嵌入来减少词汇表参数。我们训练了三个递归模型,发现它们在 10M 和 100M 字数方面优于标准 Transformer,同时与 BabyLM Challenge 2025 获胜者保持竞争力。