论文

相关不等于充分:长期记忆问答如何补齐证据

Relevance Is Not Sufficiency: What Actually Closes the Evidence Gap in Long-Term Memory QA

上下文与知识检索增强记忆

摘要

跨多个会话与用户交互的 LLM Agent会积累超出其上下文窗口的历史记录,因此它们将过去的交互存储在外部存储器中,并从一小组检索到的记录中回答每个问题。现有的记忆系统按词汇或嵌入相关性对记录进行排名,但排名靠前的记忆可能都是相关的,同时共同忽略了答案所需的补充事实,特别是对于多会话和时间问题。利用法律证据学术中相关性和充分性之间的区别,我们将记忆检索重新定义为构建足够的记忆集。为了实现这一观点,我们引入了对检索到的集合的盲法 LLM 判断,以及 Gold Hit 和 Turn Hit 作为证据覆盖代理。然后,我们提出预算扁平重建(BFR),它分两个阶段在固定扁平内存存储上构建足够的集合。具体来说,我们首先应用记忆选择的形式概念分析(FCA-MS)将问题分解为信息需求,并选择共同覆盖它们的紧凑候选子集。然后,我们通过更深入的文本搜索或补充实体和会话视图反复获取看不见的记录,并在预算耗尽时停止。 LoCoMo 和 LongMemEval-S 上的实验表明,BFR 在答案质量和证据覆盖率方面均优于最新代理记忆系统的同存储适应。具体来说,在 LongMemEval-S 上,它将判断准确率从 72.4% 提高到 82.2%,将命中率提高到 91.4%。

相关不等于充分:长期记忆问答如何补齐证据:论文原图
图 2:top-kk 与集合级别充分性的相似性。 (a) 先前的内存架构根据查询相似度对记录进行排名并返回 top-kk 切片。 (b) BFR 在扁平存储上返回足够的集合:它首先选择共同满足问题要求的补充记录,然后通过通过文本、实体和会话视图添加未见过的记录来完成预算下缺失的支持。