论文

PI-Mem:利用并行迭代内存将长上下文推理推向 360 万个词元

PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory

摘要

长上下文推理仍然是 大语言模型 的关键瓶颈,因为最近的循环记忆方法面临两个固有的挑战:连续的块更新可能会用后来的不相关内容覆盖早期的关键证据,并且串行块间依赖性限制并行性并导致延迟随着上下文长度而增加。为了解决这些问题,我们提出了 PI-Mem(并行迭代内存),这是一种并行处理所有块并在有限轮数内迭代细化共享内存的机制。在每一轮中,PI-Mem 以当前内存为条件并行读取所有块,从每个块中选择新的或补充的证据,并将所选证据合并到下一轮的紧凑共享内存中。为了阻止冗余转向,我们通过强化学习和辅助转向效率奖励来优化工作流程,使模型能够在积累了足够的证据后自适应退出。我们在 HotpotQA 基准上使用 Qwen3.5-35B-A3B 和 Qwen2.5-7B 在上下文长度高达 360 万个 token 的情况下评估 PI-Mem,发现它比循环内存基准高出 +6.25 和 +7.81 绝对点,同时分别实现 6.1$\times$ 和 2.1$\times$ 推理加速。这些结果表明,PI-Mem 打破了长上下文推理中准确性与效率的权衡,并提供了一种可扩展的方法来针对极长文档进行复杂的多跳问答。