论文

GateMem:多主体共享内存代理中内存治理的基准测试

GateMem: Benchmarking Memory Governance in Multi-Principal Shared-Memory Agents

模型评测基准与评测资源

摘要

LLM 代理的内存基准在很大程度上假设单用户设置,从而使医院、工作场所、校园和家庭的共享助理没有得到充分研究。在这些部署中,多个主体写入公共内存池并在不同的角色、范围和关系下对其进行查询,因此内存质量需要治理和召回。我们引入 GateMem,这是多主体共享内存代理的基准。 GateMem 联合评估合法长范围请求的效用,包括状态更新、跨上下文授权边界的访问控制以及显式删除请求后面向代理的主动遗忘。它跨越医疗、办公、教育和家庭领域,具有长篇多方情节、增量内存注入、隐藏检查点、结构化判断和泄漏目标注释。在不同的基线和骨干模型中,没有任何方法可以同时实现强大的实用性、强大的访问控制和可靠的遗忘。长上下文提示通常会以较高的词元成本产生最佳的治理分数,而基于检索和外部记忆的方法会降低成本,但仍然会泄漏未经授权或已删除的信息。这些结果表明,当前的记忆代理距离可靠的共享机构部署还很远。