论文

RouteSparse:用于预算长上下文预填充的输入条件模式路由

RouteSparse: Input-Conditional Pattern Routing for Budgeted Long-Context Prefilling

模型推理推理加速

摘要

动态稀疏注意力可以在不改变模型权重的情况下减少长上下文预填充的二次成本。 MInference 为每个注意力头分配一个离线模式,并估计每个提示的该模式的稀疏索引。这种设计是有效的,但它假设头部的首选模式和稀疏预算在输入中保持合适。我们引入了 RouteSparse,它在 GPU 高效稀疏模式的小型库中路由每个头部和提示段。低成本探针估计模式效用和不确定性;然后,延迟感知路由器会选择模式和预算,而不确定的情况则回落到更密集的掩码。我们将路由表示为受限风险最小化,从省略的概率质量中导出注意输出错误证书,并评估该方法在长上下文检索、问答、摘要和语言建模方面的性能。在具有 128K 词元提示的 Llama 3.1-8B-Instruct 上,RouteSparse 实现了 $6.5\times$ 密集预填充速度,相对于密集注意力,标尺下降了 0.2 点,而固定每头路由的速度为 $7.3\times$,下降了 1.6 点。消融证实输入条件路由、硬件分析和选择性密集回退都有助于质量与延迟的权衡。