论文
结构化信念状态和 LLM 记忆检索的第一个精确感知基准
Structured Belief State and the First Precision-Aware Benchmark for LLM Memory Retrieval
摘要
当前的 LLM 记忆基准评估答案质量而不是检索准确性。因此,转储整个信念存储的系统可以实现完美的召回并掩盖严重的精度故障。我们表明,这种评估差距在多个嵌入模型中持续存在,其中对特定领域语料库的基于相似性的检索本质上难以将目标信念与语义上接近的信念分开。此外,多轮主题漂移加剧了这种检索噪音,同时增加了延迟和运营成本。为了将检索质量与生成性能分离,我们引入了 PrecisionMemBench,这是一个包含 89 个案例的基准测试,用于测量精度、噪声隔离、会话延迟和置信可变性。我们还提出了 Tenure,一种结构化的信念存储代理,它可以在推理之前解决范围和检索问题,并在模型看到提示之前将类型化的信念状态作为环境指令注入,从而消除模型端对是否查阅记忆的自由裁量权。经过 13 种配置的评估,Tenure 在所有活动、非会话和会话测试用例中实现了完美的检索传递。相比之下,基线配置甚至无法达到一半的活动通道,精度分数集中在 0.22 及以下。我们的结果表明,虽然当前的记忆系统成功地存储信息,但它们无法干净地检索信息。传统答案质量基准掩盖了结构性漏洞。