论文

OVAL:用于 KV 缓存检索的输出感知本地页面库

OVAL: Output-Aware Local Page Bases for KV Cache Retrieval

模型推理KV Cache

摘要

使用大语言模型进行长上下文推理变得越来越昂贵,因为注意力必须在不断增长的 KV 缓存上运行。页面稀疏注意力通过紧凑地表示每个 KV 页面并仅检索每个查询的子集来降低此成本。现有的检索方法旨在估计注意力分数或页面相关性,但其目标并不直接考虑近似误差如何影响结果值加权注意力输出。我们引入 \method{},一种从键和值的联合结构派生的输出感知页面编码,同时保留准确检索所需的关键信息。 \method{} 是训练自由的,并且在推理时不需要额外的值相关统计信息。一旦构建完成,其存储的表示具有与仅关键频谱表示相同的大小和解码时间评分成本。在长推理、长上下文理解和长生成基准方面,\method{} 持续改进了仅关键的谱基线,并且与最新的 KV 缓存压缩和检索方法相比,性能具有竞争力。在长推理基准上,它在模型基准对上实现了强大的 avg@\(k\) 性能,同时在几个长上下文理解和生成设置上以适度的解码开销匹配或超越领先基线。代码可在 \url{https://github.com/Ashkan13776/oval-kv} 获取。

OVAL:用于 KV 缓存检索的输出感知本地页面库的原论文方法或结果图
图 1:稀疏 KV 检索的页面表示概述。 (a) 仅关键摘要和 (b) 关键近似仅根据关键信息构建检索表示,因此没有明确考虑输出敏感性。因此,诸如 $p_{3}$ 之类的输出重要页面可能会低于顶部 $2$ 检索截止值。 (c) OVAL 在构建输出感知基础时改为使用键和值,保留对键保真度和输出灵敏度都很重要的方向。