论文

基础裂缝:看似次要的架构选择影响长上下文扩展

Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

模型评测模型行为与机制分析

摘要

人们可能会认为密集 Transformer 范例中的架构变化对准确性的影响有限。然而,我们证明在长上下文环境中情况并非如此。具体来说,我们展示了一组四个次要的架构决策(全部由 Olmo、Llama 和 Qwen 密集模型系列中的至少一个做出)对长上下文可扩展性产生复合负面影响。单独使用这些选择中的任何一种都会对长上下文性能产生较小的影响,但组合三种或更多可以使下游性能下降高达 47%。此外,从短上下文丢失或验证数据集中无法检测到这些差异。我们表明,跨模型系列的长上下文能力的大部分变化是由这些架构特征驱动的,并且可以通过在预训练早期应用上下文扩展来检测。我们通过受控消融来证明这一点,这些消融固定数据、分词器和扩展配方,同时改变标准化、GQA、预训练上下文长度和滑动窗口注意力。经过超过 170,000 个 GPU 小时的训练后,我们将生成的模型集发布为 OlmPool,这是一组 26 个可比较的 7B 模型,在长上下文扩展之前和之后都有检查点。该池包含多种在长上下文可扩展性方面优于 Llama 3 架构的架构。在对我们的消融模型的分析中,我们识别了由于特定架构差异而引起的注意力集中行为和跨上下文的注意力分布模式。