论文
WhenLoss:诊断长上下文记忆系统中的写入和检索瓶颈
WhenLoss: Diagnosing Write and Retrieval Bottlenecks in Long-Context Memory Systems
摘要
长上下文记忆系统通常会在固定预算下失败,但端到端评估并不能揭示证据是否在压缩过程中被丢弃或保留但从未检索。我们引入了一种四条件诊断协议,该协议在截断的完整上下文(TFC)、预言证据(OE)、完整存储记忆(CSM)和检索记忆(RM)下评估固定读取器。在这种固定预算的 LongMemEval 设置下,对于大多数测试的基线来说,写入侧间隙超过了检索侧间隙,在我们的默认诊断裕度下,六个基线中有四个稳健地以写入为主。受此诊断的启发,我们提出了预期预测压缩 (EPC),它将关键决策(保留哪些信息)转移到写入时间,通过使用 LLM 来预测未来可能出现的问题,并在 词元预算 下保留最少的支持证据,同时在提问时保持检索不变。在三个读者(GPT-5.2、Claude Sonnet 4、Gemini 2.5 Pro)的所有 500 个 LongMemEval 问题中,EPC 在所有系统中实现了最高的 CSM 分数(摘要 (LLM) 为 0.49 比 0.44,最强基线),将 Delta_write 减少到 0.04,同时使 Delta_retr 与其他系统相当基于 LLM 的系统。这些结果表明,在此基准和评估设置上,改进写入阶段保留的内容是测试系统性能提升的关键途径。