论文
从 KV 缓存压缩的角度重新思考 LoRA 内存
Rethinking LoRA Memory Through the Lens of KV Cache Compression
摘要
参数检索增强将文档信息编码到轻量级、特定于文档的模块(例如 LoRA 适配器)中,从而减少了将所有证据作为输入上下文的需要。然而,目前尚不清楚该参数侧内存如何与存储在 KV 缓存中的上下文侧内存交互。我们通过逐步驱逐文档键值状态并测量文档 LoRA 何时贡献超出保留的上下文来研究文档级问答中的这种交互。我们发现,当 KV 缓存基本完好时,文档 LoRA 几乎不会增加任何内容,但在积极压缩的情况下变得越来越有用,当没有文档上下文剩余时,可以恢复 13-21 个 ROUGE-L 点。当基本模型对文档进行编码时,增益最大,并且适配器仅在答案生成期间应用,这表明文档 LoRA 更好地理解为解码时参数存储器,而不是文档编码器。最后,QA 式监督产生的适配器比原始上下文下一个标记预测要强大得多。这些结果将文档 LoRA 定位为一种补充性记忆通道,当上下文证据稀缺时,其价值就会准确地显现出来。