论文

CoWindow Attention:完整因果覆盖是集体性质

CoWindow Attention: Full Causal Coverage Is a Collective Property

模型架构Transformer

摘要

FullAttn 反复向每个注意力头公开完整的因果历史,即使使用 IO 高效的密集内核,也会产生大量冗余计算和内存流量。我们引入了 CoWA,一种结构化的注意力架构,可以跨 KV 头分配对因果历史的访问。所有头共享近对角线和前缀汇窗口,而互补的远程窗口则划分剩余的历史记录。他们的联盟提供了完整的因果覆盖,尽管每个头都很少关注遥远的标记。这种位置定义的注意力模式不需要学习路由器或索引器,在训练和推理过程中一致使用,并与 KV-head 张量并行性保持一致。 8K 的窗口匹配消融隔离了互补远程分配的影响:具有 100% 集体覆盖的 CoWA 达到 89.73% 的准确度,而 FullAttn 的准确度为 89.97%,而重复的远程窗口的表现要差得多。通过与匹配的词元预算进行更广泛的受控关联回忆比较,CoWA 随着上下文的增长密切跟踪 FullAttn,而其他稀疏模式会丢失很大一部分关联。在具有张量并行性的 128K 词元的注意力算子基准测试中,与 FullAttn 相比,CoWA 将训练期间的前向和后向延迟减少了 7.4 倍和 8.6 倍,将推理期间的解码延迟减少了 3.0 倍。其每列峰值算子内存在训练期间与 FullAttn 匹配,但在解码期间低 7.6 倍。在从 0.6B 到 14B 参数的标度律训练中,CoWA 密切跟踪 FullAttn 的困惑度,同时减少总训练失败次数。通过单独的持续训练得到的 14B 模型和 32B 模型获得了与 FullAttn 相当的知识、推理和长上下文检索分数。这些结果表明,完全因果覆盖可以是头部集合的集体属性,而不是每个头部的重复属性。