论文
LongCat稀疏注意力:通过流式感知的跨层分层索引控制计算
LongCat Sparse Attention: Taming the Lightning via Streaming-aware Hierarchical Cross-Layer Indexing
摘要
深度探索稀疏注意力(DSA)通过其闪电索引器(Lightning Indexer)实现了长上下文模型的高效表示。然而,实际部署受到索引器昂贵的$O(L^2)$评分开销和由其输出引起的硬件不效率、断续的内存访问模式的限制。为解决这些系统级瓶颈,我们引入了长猫稀疏注意力(LSA),这是一个硬件-算法协同设计的框架,包含三个互补且互斥的策略:(1)流式感知索引,通过选择性地将散乱的KV条目转换为硬件对齐的连续布局,以实现缓存区高速缓存访问;(2)跨层索引,通过在连续层之间重用由单层产生的评分结果,支持跨层校准;(3)分级索引,采用粗到细的评分方案,逐步缩小每个查询候选集,从而显著减少评分计算。广泛的扩展性实验,包括从69B-A3B到560B-A27B模型,展示了LSA在通用型和长上下文基准上始终如一地实现与全注意力性能相当的表现。此外,LSA支持高达一百万个词元的上下文长度的原生训练,并支持长猫-2.0(1.6T-A48B)。为了进一步研究,我们还引入并开源了长猫-闪存-轻-稀疏(69B-A3B),该模型将LSA集成到长猫-闪存-轻中,并更新了长上下文训练数据集。
