论文

UniPrefill:通过分块动态稀疏化实现通用长上下文预填充加速

UniPrefill: Universal Long-Context Prefill Acceleration via Block-wise Dynamic Sparsification

模型推理推理加速

摘要

随着 大语言模型 (LLM) 的不断快速发展,它们的能力越来越强,同时要求上下文长度越来越长。为了提高长上下文处理的推理效率,最近提出了几种新颖的低复杂度混合架构,有效减轻了长上下文推理的计算负担。然而,现有的长上下文预填充加速研究仍然主要集中在稀疏注意力机制上,这种机制只有在全注意力模型上才能实现最大加速。当转移到新兴架构(例如线性/全注意力混合或滑动窗口/全注意力混合)时,这些预填充加速方法会遭受显着的性能下降。此外,此类方法通常与连续批处理不兼容,使其难以集成到 vLLM 等现代推理引擎中。为此,我们提出了UniPrefill,一个几乎适用于任何模型架构的预填充加速框架,它直接加速词元级上的模型计算。我们进一步将 UniPrefill 实现为连续批处理运算符,并扩展 vLLM 的调度策略,以原生支持 UniPrefill 的预填充解码协同处理和张量并行,从而使其能够无缝集成到 vLLM 中。 UniPrefill 在首次词元时间 (TTFT) 方面实现了高达 2.1 倍的加速,并且随着并发请求数量的增加,加速变得越来越明显。