论文

MemArena:大规模设备上代理个人记忆助手的以自我为中心的基准

MemArena: An Ego-Centric Benchmark for On-Device Agentic Personal Memory Assistants at Scale

模型评测基准与评测资源

摘要

边缘部署的个人记忆助手必须使用开放权重模型处理设备上的私人人际对话。然而,现有的记忆基准测试常常未能充分测试活动密集的交互、以自我为中心的视角和连贯的多会话世界的组合。 MemArena 通过其 MASim 代理模拟器构建的单一世界对话基准填补了这些空白,在 15 天内针对 50 个代理(1030 万个对话文本词元、24100 个纯文本自我观察词元/代理/天)。通过交互历史,它共同生成了超过六个回忆、推理和可信度评估维度的 真值。我们使用 Vanilla context、BM25-RAG、Oracle 检索、Memobase 和 MemSearch 作为内存后端来评估五种开放权重阅读器。三个结果脱颖而出:(1) 内存后端选择对于内容准确性更为重要:在 Qwen3-0.6B 中,Memobase-to-MemSearch 获得了 +32.5/+19.2 pp,超过了 MemSearch 阅读器扩展(+10.6/+6.8 pp)。 (2) 权限感知访问普遍失败,Oracle 泄漏严重,而其他后端则不敢透露。 (3) 仅在非常小的读取器上搜索延迟:在 Spark GB10 边缘节点上,内存搜索增加了适度且固定的 87/7/48 毫秒 (BM25-RAG/Memobase/MemSearch),这构成了大多数读取器后端组合的 TTFT 的一小部分。代码、MASim 模拟器和 MemArena-L 基准测试将在接受后发布。