论文
SparseEngine:稀疏优先推理引擎
SparseEngine: Sparse-First Inference Engine
摘要
长上下文 LLM Agent会累积交互历史,从而给 KV 缓存和注意力计算带来压力。尽管稀疏注意力降低了这些成本,但异构缓存表示和工作流程阻碍了与现有推理引擎的集成,而先前的稀疏服务抽象仅支持特定的布局或工作流程。我们提出了 SparseEngine,一个从头到尾、稀疏优先的推理引擎,其共享生命周期契约让每个方法控制其 KV 表示和计算,同时与公共服务基础设施协调状态转换。 SparseEngine 支持跨四个类别的 15 种方法,并通过 Chain Cache 实现跨请求状态管理,Chain Cache 从保留的历史中恢复 KV 驱逐方法,以及可控的 Prefix-Cache Pruning,从选定的历史区域中删除 KV,同时保留逻辑前缀匹配。在保持方法质量的同时,SparseEngine 通过 KV 逐出提供了超过 10 倍的吞吐量,在匹配并发性下的解码速度比 vLLM 快了 2.5 倍以上,并且在代理基准测试中实现了超过 2 倍的端到端加速。该代码可在 https://github.com/CURRENTF/SparseEngine. 获取