论文

SeDeM:用于长上下文问答的隐藏状态记忆的选择性解压缩

SeDeM: Selective Decompression of Hidden-State Memories for Long-Context Question Answering

上下文与知识上下文工程

摘要

使用 大语言模型 (LLM) 进行长上下文推理的成本很高:预填充期间的自注意力与序列长度成二次方缩放,并且键值 (KV) 缓存随着处理的词元数量而增长。较大的上下文窗口也不能确保可靠的证据使用。上下文压缩降低了这种成本,但许多软压缩方法使用 LLM 作为压缩器,并依赖紧凑的内存词元来保存信息并调节解码器。我们提出了 SeDeM,一种选择性解压缩框架,可将紧凑型内存存储与解码器条件解耦。 SeDeM 将上下文存储为紧凑的隐藏状态内存块,选择与查询相关的块,并仅解压缩所选块以进行解码器调节。因此,解码器避免了全上下文处理和从高度压缩的内存槽直接生成。在四个长上下文 QA 基准测试中,SeDeM 在 1B 和 3B 同主干设置中的主要比较中获得了比压缩基线更高的 QA 分数,并且 3B 主干在三个数据集上超过了全上下文 微调。 SeDeM 还提供了有利的质量-效率权衡,相对于 ICAE,实现了 1.74--2.46$\times 较低的在线首次词元时间和 1.08--1.10$\times$ 较高的自回归解码吞吐量,同时保持了强大的答案质量。