论文

放置是自由的,但组合不是:拉丁方作为异构序列混合器堆栈的可证明平衡结构

Placement Is Free, Composition Is Not: The Latin Square as a Provably-Balanced Construction for Heterogeneous Sequence-Mixer Stacks

模型架构混合架构

摘要

自 GPT 以来,大多数 Transformer 在每一层都重复了相同的注意力机制。然而,这种设计很大程度上是一种约定,而不是经过测试的结论。当多个序列混合器组合在一个堆栈中时,机制选择、放置或两者都可能会产生改进,从而使因果归因变得困难。我们引入了 Aether-7B-5Attn,这是一个 6.59B 参数的专家混合模型($\approx$2.98B 活跃),其 49 层包含七个序列混合机制,排列为 $7\times7$ 拉丁方。由于每个机制在每一行和每一列中只出现一次,因此该设计保证了深度上的均衡曝光,同时消除了放置混乱。为了评估这一原理,我们构建了一个参数匹配代理,其中有四种机制,在十六层上排列为 $4\times4$ 拉丁方,匹配 700.9M 参数,并用每臂 8 个种子进行训练。结果显示明显的解离。将分布式异构堆栈重新排列为平衡的周期性循环仅将验证损失更改为 0.16\%,这表明精确放置几乎没有影响。相比之下,将相同的机制聚集到连续的深度带中会产生 0.59% 的惩罚,而用同构堆栈替换异构堆栈会产生 1.68% 的惩罚。这些结果表明,性能主要取决于分布在深度上的异质成分,而不是任何特定的排列。我们在 2.16$\times$ 的较大规模(1.514B 参数)上证实了这一发现,其中同质堆栈惩罚增加到 2.63\%,并且删除 SSM 系列机制会产生 3.20\% 的退化。我们进一步报告每个机制的成本概况、英语和韩语评估以及所有 49 层的因果安全审计。我们发布模型权重、训练配方、训练代码、日志和架构源代码。