论文
快速语言建模
Express Language Modeling
摘要
我们引入了一种新工具 Express,用于将非因果注意力近似转换为具有匹配近似保证的因果近似。当与最先进的 Thinformer 近似相结合时,Express 改进了最著名的因果注意力保证,为长度为 $n$ 的序列提供了 $\log^{3/2}(n)/s$ 近似误差,仅需要 $O(s)$ 内存和 $O(s^2 \log^2(n))$ 压缩开销。我们将这些开发与高效的 I/O 感知 Triton 实现相结合,展示了相对于 FlashAttention 2 的显着加速,并使用 Express 克服了语言建模管道中的四个资源瓶颈:长上下文预填充、KV 缓存压缩、长格式内存约束解码和长格式计算约束解码。