论文

阅读前先听并吟诵:LM 预训练 中的美丽阶梯

Listen and Chant Before You Read: The Ladder of Beauty in LM Pre-Training

模型训练预训练

摘要

我们证明了 预训练 和 Transformer 在语言之前的音乐显着加速了语言习得。使用钢琴演奏(MAESTRO 数据集),开发管道——音乐$\to$诗歌$\to$散文——比随机初始化($p < 0.001$,5 个种子)产生了 $17.5\%$ 的困惑度改进,音乐和诗歌改进了正交模型组件(分别是内部计算和嵌入)。收敛测试证实这不是一个暂时的领先优势:在 $d\!=\!64$ 处,多种子验证(5 个种子)显示出在稳定状态 ($p = 0.017$) 时持续存在 5.5% 的差距,管道收敛得更快,每次运行的损失也更低。真实音乐将合成模式的传输上限与三分之一的数据相匹配,并且缩放实验表明,最佳 预训练 数据量随模型容量的变化而变化(较大数据集的 $-3\% \to +3\% \to +6\%$ 优势从 $d\!=\!16$ 到 $d\!=\!64$)。在我们研究的各个尺度($d\!\in\!\{16,32,64\}$,高达 ${\sim}400$K 参数)中,这些结果提出了一种依赖于容量的数据管理原则,并表明结构化的人类创意输出可以为小语言模型提供有效的 预训练 基础;在现代 预训练 规模上得出更强有力的结论将需要更大规模的实验。