论文

推理时上下文稀疏性:幻象还是机遇?

Inference Time Context Sparsity: Illusion or Opportunity?

模型推理推理加速

摘要

稀疏性长期以来是LLM效率的核心主题,但它在上下文处理中的作用仍未有定论。随着LLM负载转向更长上下文与智能体交互,注意力的算力与内存瓶颈日益关键,引出这些约束是否根本性的问题。我们的立场是:这些约束是人造且非必要的,LLM推理的未来在于沿上下文维度的极端而有原则的稀疏性。这一立场有多条实证与理论证据支撑。首先,我们认为对稠密注意力的坚持并不合理,因为在长上下文中,查询实际上是将 O(N) 的注意力信息投影到维度 d << N 的隐藏空间,该过程本质上是有损的。其次,我们对LLM稀疏性开展了一项广泛研究,涵盖五个模型家族的20个模型、不同上下文长度与不同稀疏度。我们以实证方式展示出一个强趋势:当前LLM尽管未针对上下文稀疏性训练,却对推理时解码稀疏性表现出显著的鲁棒性,覆盖检索、多跳问答、数学推理与智能体编程等不同复杂度的任务。重要的是,我们还表明现有硬件已足以从这种稀疏性中获得可观收益。例如,在H100等硬件上,我们的稀疏解码内核在50倍稀疏度下将大上下文处理相对FlashInfer加速最高10倍。总体而言,这些结果表明,极端上下文稀疏性并非一种启发式技巧,而是LLM推理、训练与架构设计的一个有原则的基础:它既可行又有益,是未来系统一个引人注目的方向。

推理时上下文稀疏性:幻象还是机遇?:论文配图
(a) 跨解码机制的推理时间注意力 I/O。(b) 跨工作负载的 Qwen3.5-27B。图 1:推理时间 50×50\times 上下文稀疏性通过构造 (a) 是带宽友好的,并且在单个模型上的不同工作负载中保持近乎密集的质量 (b)。 (a) 三种解码机制共享 HBM 频带,但读取方式不同。 Dense 每一步都会读取完整的 KV 缓存(𝒪⁡(N⋅d)\mathcal{O}(N{\cdot}d) 字节);通过轻量级索引器进行稀疏路由,该索引器选择 kk 行 (𝒪⁡(k⋅d)\mathcal{O}(k{\cdot}d) 个字节,k≪Nk{\ll}N);线性(门控 DeltaNet)读取固定大小的循环状态 SS(𝒪⁡(d2)\mathcal{O}(d^{2}) 字节,NN 中的常数)。 H100/B200 上这三者均受内存带宽限制;对比是每步流量是否随上下文长度变化。 (b) Qwen3.5-27B 上的四个工作负载,按 (T,D,C)(T,D,C) 顺序增加复杂性 - 轮次、每轮解码令牌、每轮输入上下文 (§3)。配置:RULER-HARD-32K (T=1,D<1CLOSE(T{=}1,\ D{<}1K,C=32,\ C{=}32K)); LOFT-128K (T=1,D<1CLOSE(T{=}1,\ D{<}1K,C=128,\ C{=}128K)); AIME-2025 (T=1,D≈25CLOSE(T{=}1,\ D{\约}25K,C<1,\ C{<}1K)); SWE-Bench Django (T≈67,D∼1CLOSE(T{\approx}67,\ D{\sim}每回合 1K,C,\ C 增长到 >100{>}100K))。在检索(RULER、LOFT)、推理(AIME)和代理编码(SWE-Bench S3S_{3} 子集,n=58n{=}58,App.B)上,在 50×50\times 的 50×50\times 稠密点内稀疏。 H100/B200 上的内核级加速推迟到第 4 节和选项卡。 1.