SocialMemBench:AI 记忆系统是否已准备好用于社交群组设置?
SocialMemBench: Are AI Memory Systems Ready for Social Group Settings?
摘要
人工智能助手的记忆系统是为单用户对话而构建的,在应用于多方社交群体设置时通常会失败。这种差距对于当今正在建立的社交助理来说很重要:嵌入聊天平台中的集体行动代理,以及主动的个人助理代理,其用户的整体模型必须包括他们的社交背景。现有的记忆基准评估二元或工作场所对话;没有一个是针对多方社会群体的,在这些群体中,记忆必须将事实锚定在共同的历史而不是职业角色中,将群体规范与个人例外区分开来,甚至在成员离开后也能正确归因。我们引入了 SocialMemBench,这是经过人类验证的合成社交群体网络的基准,涵盖五个原型(亲密朋友、家庭、娱乐、兴趣社区、熟人网络)和三个团体规模级别(4-30 名成员),拥有 430 个角色和 7,355 个对话轮次,在 9 个问题类别中生成 1,031 个 QA 对。每个类别隔离一个架构功能,并且五种故障模式(单流合并、时间状态覆盖、大规模实体合并、缺少跨角色知识、规范个体合并)是可测试的假设;我们的两项研究调查Subject-Mem 和 SMG 提供了其中两、三项仍处于开放状态的证据。全上下文 Gemini 2.5 Flash 参考仅达到 0.721,而小型网络上的盲评推理模型平均值为 0.98,这表明即使完全访问对话,基准测试也确实很困难。在所有 43 个网络中,四个开源记忆框架(Mem0、LangMem、Graphiti、Cognee)评估的问题加权范围为 0.12-0.18,CI 重叠率为 95%,远低于未压缩检索参考 0.345 和匹配回答者全上下文参考 0.369 (GPT-4o-mini)。当前的记忆系统存在明显的差距。