论文

比较 Transformer 和 词元级 的混合模型

Comparing Transformers and Hybrid Models at the Token Level

模型评测模型能力评测

摘要

混合注意力层和循环层的混合语言模型已经显示出希望:理论上,循环层改善了纯 Transformer 在状态跟踪方面的局限性,并且从经验上看,混合模型在损失和下游评估方面可以优于纯 Transformer \citep{waleffe2024empirical,merrill2026olmohybrid}。然而,目前尚不清楚哪些数据或能力推动了这些成果,以及它们在多大程度上反映了推动混合模型的理论优势。我们使用 Olmo 3 \citep{olmo2025olmo3} 和 Olmo Hybrid \citep{merrill2026olmohybrid} 的开放权重来解决这个问题:我们比较相同前缀下相同目标词元的匹配 Transformer 和混合的损失,通过自然词元标签、复制特征、分隔符结构和受控合成探针对结果进行分层。混合在大多数标签族上具有较低的损失,但增益并不均匀:对于开放类实词来说,增益最大,而对于许多封闭类功能词来说,增益较小。在散文、代码和标记中,混合的损失优势在开始分隔符上比在相应的结束分隔符上更大,并且在重复的 $n$-gram 上几乎消失。合成探针显示出相同的分裂:混合探针更适合代词记忆和实体跟踪任务,而 Transformer 更适合需要选择结束分隔符的括号匹配任务。这些模式表明,混合中的循环层改进了利用文档语义状态的预测,而注意力有助于通过 $n$-gram 复制或句法括号匹配来预测标记。最后,我们通过概念验证过滤评估来展示 词元级 分解如何增强混合架构的预训练诊断。