论文

KAP:弥合 LLM 系统中的知识选择与运行时消耗差距

KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems

模型推理KV Cache

摘要

现代 LLM 系统越来越依赖于产生高价值结构化先验的知识选择过程,例如排名证据、图拓扑、多模态对齐和置信度信号。然而,LLM 服务从根本上仍然忽略了这种丰富的结构:一旦此类信号被序列化为提示,后端只能观察到平面词元序列,从而在解码过程中强制密集且均匀地消耗完整的键值 (KV) 状态。我们将这种架构不匹配称为知识选择-运行时消耗(KSRC)差距:更丰富的上下文会扩大完整提示的 KV 占用空间和解码时内存流量,即使推理仅依赖于上下文的一小部分,也会增加延迟并降低吞吐量。为了弥补这一差距,我们提出了知识访问规划(KAP),这是一种范式转换的执行抽象,可将结构化知识先验从被动提示构建提示提升为一流的物理执行工件。 KAP 建立了通用中间表示(IR)——运行时访问计划——编译结构化知识信号来管理物理 KV 访问,而不改变逻辑提示语义、模型权重或训练程序。通过此 IR,KAP 将 LLM 服务从词元感知上下文消费转变为计划驱动、知识感知运行时消费。我们使用 GraphSpec 实例化 KAP,GraphSpec 是一种将结构化知识选择连接到 LLM 服务后端的编译器执行器实现。我们推导出计划引导执行的正加速机制的阶段边界模型。在 4K-128K 长上下文 QA 工作负载中,GraphSpec 保持了与全上下文解码相当的答案质量,同时将物理 KV 消耗与提示长度解耦,将提议时间 KV 访问减少到 128K 时源 KV 状态的 5.5%,并从根本上改变了长上下文生成的扩展轨迹。