论文
抛锚:通过 Pulsar Attention 对分布式系统进行统计上下文总结
Dropping the Anchor: Statistical Context Summarization for Distributed Systems via Pulsar Attention
摘要
由于自注意力的二次复杂度,在长序列上使用 大语言模型 (LLM) 进行推理的计算成本很高。分布式分块方法(例如 Star Attention)通过跨主机分片上下文来降低成本,但依赖于将第一个块的静态、内容盲副本预先添加到每个主机。我们提出了 Pulsar Attention,它用两个轻量级的内容感知组件取代了静态锚点:一个稳定 softmax 的小型注意力接收器前缀,以及通过 Max-IDF 启发式构建的紧凑跨块摘要,该摘要选择包含全局稀有标记的块。这使得第一阶段每 GPU 的 FLOP 比 Star Attention 减少了 3.3 倍,同时保留了相同的 KV 缓存占用空间。在使用 Llama-3.1-8B-Instruct 的 RULER 上,Pulsar Attention 在序列长度高达 128K token 的情况下优于 Star Attention,并且在大多数任务中与密集注意力保持竞争力,与密集基线相比,任务相关的绝对增益高达 4.7%。