论文
Pull:工作记忆的惰性物化,用于有状态的 LLM 对话
Pull: Lazy Materialization of Working Memory for Stateful LLM Conversations
摘要
随着 LLM 对话增长到数百轮,全上下文注入会产生 $O(N^2)$ 累积词元成本,而有损摘要或硬截断会不可逆地丢弃历史状态。我们提出 Pull,一个会话路由器,通过本地确定性 Purifier(零 LLM 调用,毫秒级延迟)维护可寻址元数据目录。在查询时,LLM 会延迟地仅实现其需要的轮次;未实现的转弯仍可通行,但已倒塌。与不可逆压缩不同,Pull 的物化是可逆的;后续查询可以展开任何折叠的转弯。在 LoCoEval(128 个对话,12,780 轮)上,Pull 在具有同等质量的单跳任务上将每个查询上下文标记(第 2 阶段)减少了 75.1%($Δ= -0.002$,n.s.),在没有质量损失的多跳任务上减少了 72.0%($Δ= +0.017$)。受控路由基准(7,831 个查询 x 10 个方法)表明,实体生命周期跟踪在经验上是距离无关路由的先决条件。在 BEAM 1M(14 个对话,263 个问题)上,Pull 将 F1 比截断基线提高了 55.2%。