论文

MemGround:游戏化场景中 大语言模型 的长期内存评估套件

MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios

模型评测基准与评测资源

摘要

目前对 LLM 长期记忆的评估基本上是静态的。通过专注于简单的检索和短上下文推理,他们忽略了复杂记忆系统的多方面性质,例如连续交互中的动态状态跟踪和层次推理。为了克服这些限制,我们提出了 MemGround,这是一个严格的长期内存基准测试,本身植根于丰富的游戏化交互场景。为了系统地评估这些能力,MemGround 引入了一个三层分层框架,通过专门的交互任务来评估表面状态记忆、时间关联记忆和基于推理的记忆。此外,为了全面量化记​​忆利用率和行为轨迹,我们提出了一个多维度量套件,包括问答得分(QA整体)、解锁记忆片段(MFU)、正确顺序记忆片段(MFCO)和探索轨迹图(ETD)。大量实验表明,最先进的 LLM 和记忆代理仍然难以应对持续的动态跟踪、时间事件关联以及源自交互环境中长期积累的证据的复杂推理。