论文
AdaMem:检索增强生成中软压缩的自适应内存词元分配
AdaMem: Adaptive Memory Token Allocation for Soft Compression in Retrieval-Augmented Generation
摘要
检索增强生成(RAG)通过检索到的证据改进了语言模型,但处理许多长段落的成本很高,并且可能会引入分散注意力的信息。软压缩通过在生成之前将段落编码为连续内存嵌入的紧凑序列来解决这一挑战。然而,现有的方法通常为每个保留的段落分配相同数量的内存嵌入,而不考虑其特定于查询的相关性。为了解决这个问题,我们提出了 AdaMem,这是一种相关性引导的软压缩框架,它将学习到的段落相关性估计映射到固定内存词元预算的查询相关分配。共享的查询条件压缩器在一次传递中产生连续的段落记忆和相关性分数;确定性分配规则将更多内存标记分配给得分较高的段落,并可以忽略得分较低的段落。在六个开放域 QA 基准测试中,AdaMem 在匹配的内存预算下始终优于 OSCAR(使用统一分配的紧密匹配的软压缩基线)以及其他软压缩方法。在标准 16$\times$ 压缩下,AdaMem 将子串匹配比统一分配基线提高了 3.2 个点 (5.5%),平均相对增益为 3.4%;在激进的 64$\times$ 压缩下,平均相对增益增长至 14.6%,PopQA 最高得分为 9.8 分 (19.7%)。 AdaMem 与未压缩的答案质量相匹配,推理延迟比完整上下文基线低 4 倍\倍。 AdaMem 保留了与均匀压缩基线相当的效率概况,同时实现比全上下文推理低 4 倍的推理延迟。因此,当检索池很大且可用内存预算紧张时,相关性引导的内存分配特别有效。