论文

存储的证据何时不再可用:智能体记忆的规模条件化评估

When Stored Evidence Stops Being Usable: Scale-Conditioned Evaluation of Agent Memory

模型评测上下文与知识记忆评测方法与指标Agent记忆

摘要

记忆代理评估报告固定快照的准确性或检索质量,但这些分数并不显示随着不相关会话(未注释为查询的任务相关证据的会话)积累,证据是否仍然可用。我们提出了一种在证据保留增长下的代理记忆的尺度条件评估协议:对于每个查询,任务证据保持固定,同时添加不相关的会话。该协议记录代理内存轨迹并报告四种诊断:符合预算的可靠性、尾部内存调用负担、故障机制分解以及可靠性低于目标的可用规模边界。该协议应用于跨平面、平面和分层内存接口的 LongMemEval 和 LoCoMo,表明可靠性损失不是单一现象。在 LongMemEval 上,HippoRAG 保持在两次调用预算之内,但由于添加了不相关的会话,因此在符合预算的可靠性方面损失了 16--20 个百分点; LiCoMemory 观察到的故障在很大程度上取决于代理,Qwen3-8B 超出了预算,而 Qwen3-32B 和 Qwen3-235B 在测试范围内仍然可靠。结果支持一个框架,该框架使可扩展内存声明以代理、接口、规模范围和交互预算为条件。