论文
比 Flash 更快:利用注意力稀疏性进行高效的长上下文解码
Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding
摘要
长上下文大语言模型(LLM)的发展受到解码过程中注意力机制的内存带宽瓶颈和二次复杂度的限制。为了克服基于元数据的指标的内存开销和自适应选择策略的计算效率低下之间固有的权衡,我们提出了更快的闪存解码(FFD),这是一种新颖的硬件算法协同设计框架,旨在打破长上下文解码中的内存墙。 FFD 将选择器和计算机集成到完全融合的内核中,通过低位量化以内容感知扫描取代外部元数据索引。此外,我们引入了顶增量策略,该策略动态过滤块以实现分布自适应稀疏性,而无需全局同步。 FFD 提供 无需训练 和即插即用解决方案,还可以重用扫描结果进行计算,实现高达 11.6 倍的内核级加速并扩展到 256K 上下文长度,端到端吞吐量提高 2.37 倍。 RULER 和 LongBench 的实证验证证实,FFD 在提供高比率稀疏性的同时保持模型准确性,代码可在 https://github.com/qluoluo/faster-flash-decoding 获取