论文

DASH-KV:通过非对称 KV 缓存哈希加速长上下文 LLM 推理

DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing

模型推理KV Cache

摘要

标准注意力机制的二次计算复杂度构成了 大语言模型 在长上下文推理中的基本瓶颈。虽然现有的 KV 缓存压缩方法减轻了内存压力,但它们往往会牺牲生成质量,并且无法解决浮点运算的高开销问题。本文介绍了 DASH-KV,这是一种创新的加速框架,它通过非对称深度哈希将注意力重新表述为近似最近邻搜索。在这种范式下,我们设计了一种非对称编码架构,该架构可以差异化地映射查询和密钥,以解释它们在精度和重用特性方面的差异。为了平衡效率和准确性,我们进一步引入了动态混合精度机制,自适应地保留关键词元的全精度计算。 LongBench 上的大量实验表明,DASH-KV 显着优于最先进的基线方法,同时匹配完全注意力的性能,同时将推理复杂度从 O(N^2) 降低到线性 O(N)。