论文
后边界桥:局部注意力必须在全局层之间走向全局吗?
Post-Boundary Bridge: Must Local Attention Go Global Between Global Layers?
摘要
混合 Transformer 通过将局部注意力与周期性全注意力层相结合来降低长上下文建模的成本。然而,当全球通信已经可用时,本地计算的最佳用途仍不清楚。我们引入了边界后桥(PBB),它保留了块内的因果注意力并添加了跨边界的直接连接。 PBB 没有扩展通过连续的本地层中继的信息范围,而是优先考虑块内建模和附近交换,将远程通信留给完整注意力层。在具有 2.05 亿至 20.7 亿个存储参数的密集和专家混合模型中,PBB 混合模型在标准下游基准测试上保留了近乎完全的困惑度和竞争性能,同时改进了受控源检索。在 2.05 亿个参数中,PBB 还在困惑度中匹配了使用滑动窗口注意(SWA)的混合,并实现了更高的源检索精度。相同的边界对齐结构支持 Flash-PBB,这是一种精确的解码实现,可以更新其键值缓存,而无需重新定位保留的条目。与 Flash-SWA 相比,Flash-PBB 提供了 1.82 倍的解码注意力核心吞吐量,且分配的本地键值缓存只有一半。这些结果表明,有针对性的边界交换可以保持模型质量,同时在全局层之间实现更快、更节省内存的局部注意力。