论文

LANTERN:用于长上下文 LLM 对话的分层档案和时间情景检索网络

LANTERN: Layered Archival and Temporal Episodic Retrieval Network for Long-Context LLM Conversations

摘要

当对话历史记录被压缩以适应有限的上下文窗口时,大语言模型 会丢弃关键细节。我们提出了 LANTERN(分层归档和临时情景检索网络),这是一个轻量级内存层,它主动归档每个对话回合,并在通过混合检索压缩后恢复相关细节 - 需要零 LLM 调用,并且每回合增加的延迟少于 25 毫秒。在 94 个真实的多回合对话中(1,894 个 真值 事实,在 kappa=0.81 下经过人工验证),LANTERN-Rerank 恢复了因压缩而丢失的 78.3% 的可验证事实,显着优于 MemGPT 的 LLM 驱动的提取和多查询搜索管道的忠实重新实现(72.4%;Wilcoxon) p<0.0001,95% CI [+3.1,+8.6] pp,d=0.43),而推理成本仅为一小部分。即使没有重新排名器,基础 LANTERN 使用零 LLM 调用也可以匹配或超过此 LLM 驱动的基线 (p=0.005)。当四个生产 LLM 使用 LANTERN 恢复的上下文回答事实承载问题时,准确度平均提高 8.4 个百分点(每个模型单独的 Wilcoxon p<0.05),这表明恢复的上下文在不同的模型架构中都很有用。我们发布了完整的评估框架——配对显着性测试、失效分析、事实类型分层和压实鲁棒性分析——以支持可重复性和未来的工作。