论文
CoEM:利用 Commit-on-Evidence Memory 增强长上下文推理
CoEM: Empowering Long-Context Reasoning with Commit-on-Evidence Memory
摘要
长上下文推理对于复杂且长期的任务至关重要,但大语言模型 (LLM) 的性能会随着上下文长度的增加而降低。最近的方法通过逐块处理输入来解决这个问题,同时在模型上下文中维护有限的文本记忆。然而,过早的信息压缩可能会丢弃后续推理所必需的关键细节。在本文中,我们介绍了证据记忆提交(CoEM),它学习何时将源证据转换为紧凑的记忆事实。具体来说,在固定的上下文内存预算下,CoEM 将潜在有用的源摘录逐字保留在待处理的集合中,允许后续上下文在不可逆压缩之前澄清其相关性。当新的上下文到来时,学习策略会重新访问每个待处理的摘录,并决定是将其提升到提交的内存中,保留它以供进一步考虑,还是丢弃它。冻结验证者确保仅在保留的摘录和当前上下文支持的情况下才接受所提出的事实。为了进一步指导有效的记忆管理,我们通过将细粒度、步骤级证据奖励与最终答案奖励相结合,使用强化学习来训练该策略。大量实验表明,CoEM 持续改进长上下文推理。当对 6,400 个文档长上下文输入进行评估时,CoEM 在 Qwen3.5-9B 上的 F1 点比最强的记忆基线高出 10.4-11.4 个点。代码存储库:https://github.com/benmagnifico/CoEM.