论文
学习检索长期记忆 QA 缺失的证据
Learning to Retrieve Missing Evidence for Long-Term Memory QA
摘要
长期记忆使语言模型能够在未来的对话中使用过去的交互。然而,回答问题所需的证据可能分散在遥远的转弯处,而问题本身却忽略了定位它所需的线索。检索到的事实可以揭示这些线索,从而根据已发现的证据激发检索决策。我们引入 MERA(缺失证据检索增强),它将全局可搜索记忆与特定问题的证据状态分开。经过验证的证据可以指导后续检索,而不会限制对全局内存的访问。我们通过强化学习训练轻量级规划器,奖励恢复先前丢失证据的查询。 MERA 在 Qwen3-30B 和 GPT-4o-mini 主干上实现了很高的答案准确性。使用 Qwen3-30B 进行证据处理和答案生成,经过训练的 0.6B 规划器在 LoCoMo 上实现了 77.40% 的准确率,在 LongMemEval-S 上实现了 71.29% 的准确率,分别比没有基于检索的训练的 30B 规划器高出 4.10% 和 3.96%。在 LoCoMo 上,后续检索轮次将累积证据召回率从 55.5% 提高到 80.5%。