论文

Olmo Hybrid:从理论到实践再回来

Olmo Hybrid: From Theory to Practice and Back

模型架构混合架构

摘要

最近的工作证明了非 Transformer 语言模型的潜力,特别是线性循环神经网络(RNN)以及混合循环和注意力的混合模型。然而,对于这些新架构的潜在好处是否值得扩大规模的风险和努力,尚未达成共识。为了解决这个问题,我们在多个方面提供了混合模型相对于纯 Transformer 的优势的证据。首先,从理论上讲,我们证明混合模型不仅继承了 Transformer 和线性 RNN 的表达能力,而且还可以表达两者之外的任务,例如代码执行。将这一理论付诸实践,我们训练了 Olmo Hybrid,这是一种 7B 参数模型,在很大程度上与 Olmo 3 7B 相当,但滑动窗口层被门控 DeltaNet 层取代。我们证明 Olmo Hybrid 在标准预训练和训练中期评估中的表现优于 Olmo 3,证明了混合模型在受控的大规模环境中的优势。我们发现混合模型的扩展效率明显高于 Transformer,这解释了其更高的性能。然而,尚不清楚为什么对特定形式问题的更大表达力会导致与这些问题无关的下游任务更好的扩展或卓越的性能。为了解释这种明显的差距,我们回到理论并论证为什么增加的表现力应该转化为更好的扩展效率,从而完成循环。总的来说,我们的结果表明,混合注意力层和循环层的混合模型是语言建模范式的强大扩展:不仅可以减少推理期间的内存,而且可以作为获得更具表现力的模型的基本方法,这些模型在预训练期间可以更好地扩展。