论文

HySparse2:具有两级 KV 共享的混合稀疏注意力

HySparse2: Hybrid Sparse Attention with Two-Level KV Sharing

模型架构Transformer

摘要

长视野和多轮智能体通常会生成短动作并处理来自工具和环境的长观察。这种不断增长的上下文需要高效的预填充、紧凑的 KV 缓存存储和准确的长上下文检索。为了满足这些需求,我们引入了 HySparse2,一种具有两级 KV 共享的混合稀疏注意力架构。在外层,KV Bridging采用YOCO式的自解码器和交叉解码器结构,但仅桥接全注意力层。自解码器使用混合滑动窗口注意(SWA),而交叉解码器使用混合稀疏注意。交叉解码器中全注意力层的 KV 缓存是根据自解码器中全注意力层的隐藏状态生成的。在内部层面,HySparse2保留了HySparse的核心KV Reuse设计,并进行了两处改进。首先,它将块级稀疏性替换为词元级稀疏性,以实现更精细的长上下文检索。其次,它从稀疏层中删除了单独的 SWA 分支,而是强制将最近词元的滑动窗口纳入稀疏选择中。这种两级 KV 共享允许所有跨解码器 KV 缓存从自解码器隐藏状态构建。因此,预填充可以在自解码器之后退出,跳过所有交叉解码器层。在 80B-A3B MoE 模型上,HySparse2 在长上下文检索和多轮代理任务方面优于 HySparse 和 Hybrid SWA,同时大幅减少预填充计算和 KV 缓存存储。