论文

GroupMemBench:多方对话中 LLM 代理记忆基准测试

GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations

模型评测基准与评测资源

摘要

大语言模型 (LLM) 代理越来越多地充当个人助理和工作场所协作者,其效用取决于在长时间运行的对话中提取、检索和应用信息的记忆系统。然而,现有的记忆系统和基准测试都是围绕二元、单用户设置构建的,尽管实际部署通常跨越多个用户与代理以及彼此交互的组和通道。这种不匹配使得群体记忆的三个属性无法测量:(i)超越串联的一对一聊天的群体动态,(ii)基于说话者的信念跟踪,其中需要每个用户的记忆建模,以及(iii)受众适应的语言,其中心理理论的转变产生特定于角色的词汇。我们引入了 GroupMemBench,这是一个公开所有这三个指标的基准测试。基于图形的合成管道可生成具有可控回复结构的多方对话,并根据每个用户角色和目标受众调整每条消息。然后,对抗性查询管道将每个问题与六个类别的特定提问者绑定,涵盖多跳推理、知识更新、术语歧义、用户隐式推理、时间推理和弃权,并迭代搜索反映综合记忆能力的具有挑战性的、现实的查询。对领先的记忆系统进行基准测试暴露出急剧崩溃:最强的记忆系统平均准确度仅为 46.0%,知识更新率为 27.1%,术语模糊度为 37.7%,而简单的 BM25 基线可以匹配或超过大多数智能体记忆系统。这表明当前的记忆摄取消除了组记忆所依赖的结构和词汇特征,使得多用户记忆远未得到解决。