论文

牢记这一点:对代理内存中的隐式关联盲点进行基准测试

Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory

模型评测基准与评测资源

摘要

长期记忆系统将用户所说的内容存储在外部存储中,并在相关查询到达时检索它。该接口基于一个非常自然的假设,以至于很少有人指出:所需的内存将类似于需要它的查询。世界知识打破了这个假设。对树坚果过敏的人应该会通过杏仁粉成分来改变对马卡龙要求的答案,但这两篇文章没有提供 检索器 可以看到的线索。我们将这种故障模式称为隐式关联盲点,并介绍了 InMind,这是一个涵盖 125 项任务、经过专家验证的基准,跨越 10 个生活领域,其中 113 项任务基于可引用的公共资源。它的配对控制将现有评估混为一谈的三种解释分开:事实从未被存储,模型缺乏桥接知识,或者事实被存储但从未浮出水面。判决是干净的。通过将决定性记忆置于上下文中,主干网回答了 84.0% 的间接查询;当必须检索相同的记忆时,六个向量、图形和代理记忆系统最多只能达到 14.4%,即使它们按需回忆相同事实的速度高达 100%。八倍维度的嵌入提高了每个系统的盲答案目标召回率,但基本上保持了空白。在查询到达之前保持内存可见的最小诊断探针可以恢复大部分间隙,定位查询条件接口本身中的故障并指向路由,决定哪些事实必须保持可见,因为开放问题 InMind 是为了评分而构建的。