论文
PReM:学习要保留什么以及何时刷新上下文压缩
PReM: Learning What to Preserve and When to Refresh for Context Compression
摘要
高效的长上下文推理不仅涉及降低内存成本,还涉及在生成过程中保持有用的上下文证据可访问。然而,现有的面向压缩的方法,例如键值(KV)缓存压缩和上下文压缩,通常要么提前决定保留哪些上下文信息,要么依赖外部压缩器。这种设计使得压缩上下文难以适应后续推理步骤所需的证据。本文介绍了 PReM(保留和刷新内存),这是一种上下文压缩框架,它维护长上下文作为模型的内部逐层 KV 内存,并学习要保留什么以及何时刷新它。具体来说,PReM 使用专用内存层来做出内存选择决策,并使用特殊的内存词元 <m> 在生成期间触发刷新。为了训练这种行为,PReM 引入了分相刷新训练,将内存选择与内存条件生成保持一致,同时保持刷新之间的连续性。 32K 词元上下文的实验表明,PReM 在 16 倍和 32 倍压缩下均优于强基线,同时在答案质量和推理效率之间保持良好的平衡。