论文
相关不等于充分:长期记忆问答如何补齐证据
Relevance Is Not Sufficiency: What Actually Closes the Evidence Gap in Long-Term Memory QA
摘要
跨多个会话与用户交互的 LLM Agent会积累超出其上下文窗口的历史记录,因此它们将过去的交互存储在外部存储器中,并从一小组检索到的记录中回答每个问题。现有的记忆系统按词汇或嵌入相关性对记录进行排名,但排名靠前的记忆可能都是相关的,同时共同忽略了答案所需的补充事实,特别是对于多会话和时间问题。利用法律证据学术中相关性和充分性之间的区别,我们将记忆检索重新定义为构建足够的记忆集。为了实现这一观点,我们引入了对检索到的集合的盲法 LLM 判断,以及 Gold Hit 和 Turn Hit 作为证据覆盖代理。然后,我们提出预算扁平重建(BFR),它分两个阶段在固定扁平内存存储上构建足够的集合。具体来说,我们首先应用记忆选择的形式概念分析(FCA-MS)将问题分解为信息需求,并选择共同覆盖它们的紧凑候选子集。然后,我们通过更深入的文本搜索或补充实体和会话视图反复获取看不见的记录,并在预算耗尽时停止。 LoCoMo 和 LongMemEval-S 上的实验表明,BFR 在答案质量和证据覆盖率方面均优于最新代理记忆系统的同存储适应。具体来说,在 LongMemEval-S 上,它将判断准确率从 72.4% 提高到 82.2%,将命中率提高到 91.4%。
