论文
TriAxialKV:面向代理推理任务的极低精度 KV 缓存量化
TriAxialKV: Toward Extreme Low-Precision KV-Cache Quantization for Agentic Inference Tasks
摘要
代理工作负载已成为 LLM 推理的主要工作负载。它们与仅聊天的工作负载有很大不同,需要长上下文处理、处理多模式输入的能力以及具有工具调用功能的结构化多轮交互。因此,它们的上下文表现出的结构可以沿着三个关键轴承载不同的重要性:当前回合的时间新近度、文本或图像标记等模态以及用户查询、工具调用、观察或推理等语义角色。这些轴捕获不同的词元行为,并导致对 KV 缓存压缩的不同敏感性。然而,现有的 KV 缓存量化方法通常是同质的,或者仅利用单一维度上的异质性,例如时间邻近性或模态,而忽略了它们之间的相互作用。为此,我们引入了 TriAxialKV,一种新颖的混合精度 KV 缓存量化方案,它为每个词元分配一个三轴标签,校准每个标签的灵敏度,并在固定内存预算下分配 INT2/INT4 位宽。我们将 TriAxialKV 实现为端到端服务系统,包括校准、混合精度量化和内存管理以及定制融合 Triton 解码内核。当使用 Qwen3-VL-32B-Thinking 作为运行 OSWorld 的计算机使用代理时,TriAxialKV 与具有 BF16 KV 缓存的 SGLang 的精度相匹配,同时支持 4.5$\times$ KV 缓存大小,并在真实 GPU 系统上运行时实现高出 30% 的端到端吞吐量。