论文

ATMA:通过极性注意力和门控增量压缩内存进行长上下文语言建模

ATMA: Long-Context Language Modeling via Polar Attention and Gated-Delta Compression Memory

模型架构混合架构

摘要

语言模型中的长度外推涉及相互竞争的目标:检索保真度、长文档可能性、短上下文质量和推理成本。我们提出了 ATMA,一种 378M 参数的混合配方,它将 Polar Attention 与门控增量循环存储器相结合,并将这些目标作为帕累托问题来研究,而不是声称一般架构的主导地位。极性注意力将归一化方向通道与有界参与比幅度通道分开。我们选择具有完整 120 单元、1B 词元阶乘扫描的配方,然后为长度为 2K 的 9.816B 词元训练匹配的 NoPE、RoPE 和 Polar 变体,并通过 256K 对其进行评估。在阶乘中,记忆提高了所有 20 个匹配细胞中 Polar 的 64K 检索得分(平均 +4​​7.8 分),而它对 NoPE 的影响很小且不一致。在 256K 时,Polar 保留了 34.4% 的教师强制目标标记准确度和 9.0% 的五标记精确度;合成上下文中的精确检索率为 18.0%,但 FinePDFs 上下文中的精确检索率为 0.0%。 Polar 还将八个短上下文任务的平均固定目标位/字节降级限制为 1.26 倍,平均成本为 1.9 点。 Raven 基线领先于 BABILong 并具有与长度无关的解码状态,说明了边界上的不同点。最后,事后检查点审计表明,几乎相同的 2K 验证曲线可以掩盖 256K 时 6.70-nat 的差异。由于这些运行既不是种子配对的,也不是跨设备随机的,因此我们将其解释为与基础设施转换相关的检查点变异性,而不是因果硬件效应。代码:https://github.com/kreasof-ai/atma