论文
长度泛化需要适当的正则化
Length Generalization Needs Proper Regularization
摘要
长度泛化是顺序模型在训练期间未见过的上下文长度上表现良好的能力。在这项工作中,我们表明实现长度泛化的挑战不仅与位置编码和注意机制等架构选择有关,而且与训练过程本身有关。我们研究正则化如何影响长度泛化,并发现权重衰减会阻碍外推。相反,当重新考虑 dropout 在架构中的位置时,它可以改善外推。在这方面,我们表明,层归一化之前的 dropout 的标准放置引入了系统的分布不匹配,并且在线性投影之前应用 dropout 解决了这个问题。例如,经过修改的具有滑动窗口注意力的 SmolLM3,不断使用 dropout 进行预训练,可以在“大海捞针”上完美推断到 64$\times$,并且远远超出 RULER 和 HELMET 上预训练的上下文大小。 Mamba2 也受益于 dropout,这表明该问题具有与体系结构无关的性质。我们进一步提出了保留方差仿射 Dropout (VPAD),这是一种新的 dropout 策略,可以大大减少由此产生的预激活方差不匹配,从而进一步改进 Transformer 的外推法。
