论文
RaBitQCache:长上下文中 KVCache 的旋转二进制量化 LLM 推理
RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference
摘要
长上下文 大语言模型 推理受到大量键值 (KV) 缓存的严重瓶颈,而现有的稀疏注意力方法经常受到静态固定预算 (Top-k) 检索的影响,或者依赖于计算成本高昂且存在偏差的代理分数。为了解决这些限制,我们提出了 RaBitQCache,这是一种新颖的稀疏注意力框架,它利用随机旋转二进制量化和高吞吐量二进制 INT4 算法来有效估计注意力权重。我们的代理分数充当无偏估计器,具有经过验证的误差范围,支持自适应 Top-p 检索,根据实际注意力稀疏性动态调整 词元预算。我们进一步实现了一个硬件感知系统,具有异步流水线和延迟更新以掩盖开销。评估表明,与最先进的基准相比,RaBitQCache 显着加速了推理并减少了内存 I/O,同时保持了生成质量。代码可在 https://github.com/Sakuraaa0/RaBitQCache.git 获取。