稀疏性长期以来是LLM效率的核心主题,但它在上下文处理中的作用仍未有定论。随着LLM负载转向更长上下文与智能体交互,注意力的算力与内存瓶颈日益关键,引出这些约束是否根本性的问题。我们的立场是:这些约束是人造且非必要的,LLM推理的未来在于沿上下文维度的极端而有原则的稀疏性。这一立场有多条实证与理论证据支撑。首先,我们认为对稠密注意力的坚持并不合理,因为在长上下文中,查询实际上是将 O(N) 的注意力信息投影到维度 d << N 的隐藏空间,该过程本质上是有损的。其次,我们对LLM稀疏性开展了一项广泛研究,涵盖五个模型家族的20个模型、不同上下文长度与不同稀疏度。我们以实证方式展示出一个强趋势:当前LLM尽管未针对上下文稀疏性训练,却对推理时解码稀疏性表现出显著的鲁棒性,覆盖检索、多跳问答、数学推理与智能体编程等不同复杂度的任务。重要的是,我们还表明现有硬件已足以从这种稀疏性中获得可观收益。例如,在H100等硬件上,我们的稀疏解码内核在50倍稀疏度下将大上下文处理相对FlashInfer加速最高10倍。总体而言,这些结果表明,极端上下文稀疏性并非一种启发式技巧,而是LLM推理、训练与架构设计的一个有原则的基础:它既可行又有益,是未来系统一个引人注目的方向。