论文

了解存储:在智能体可以读取之前,记忆后端必须写下什么

Knowing the Store: What a Memory Backend Must Write Down Before an Agent Can Read It

上下文与知识记忆Agent记忆

摘要

具有长期记忆的智能体可以从它不应再使用的记录中进行应答,例如用户后来取消的计划。我们询问记忆存储必须公开什么,以便智能体在检索任何内容之前知道这一点,并且我们自己对判断进行评分,作为元内存监控。读者只能看到一个与值无关的摘要:按生命周期状态记录计数和属性名称列表。 148 个问题中的每一个问题都是针对一家商店的三个版本提出的,这些版本在一个属性上有所不同,因此措辞无法给出答案。模型添加的内容取决于该列表的长度。在基准测试生成的最终名单中(平均 2.6 个名称),五种语言模型中没有一个能够可靠地击败名称的余弦相似度查找,并且三个更强的模型与其等效性在 0.05 以内。在固定计数和列表长度的控制下,没有一个可靠地高于它,也没有一个显示为等效的。在比我们测试写入的存储更长的列表上,填充到 60 个名称,查找损失 0.18; GPT-5.6 Luna 和 Sol 以 0.06 比 0.07 的比分落败,并以 0.13 比 0.14 领先,而其他三人也随之下跌。 Sol 领先于具有相同长度和计数的兄弟姐妹。改写为不与名字共享任何单词,查找损失了 0.02,而一位更强的读者领先了 0.04。在入围名单中,三位较强的读者仅在摘要计算一个州而不命名它的情况下领先,并且一个计数功能关闭了问题中的领先,但在项目汇集时则不然。我们测试的后端忽略或误述了此信息:在 FR-Bank 自己的元数据下,GPT-4.1 mini、Haiku 4.5 和查找从 0.73、0.82 和 0.75 下降到 0.60、0.71 和 0.59。在这些测试中,商店所写的内容限制了我们提供给它的每个读者。所有商店都是合成的;控制,更好的判断是否会产生更好的答案,留待以后的研究。