论文
DyadMem:智能体如何与用户协作的长期记忆基准
DyadMem: A Long-Term Memory Benchmark of How Agents Work with Users
摘要
长期智能体不仅要记住关于用户的事实,还要记住随着共享历史演化、特定智能体应如何与该用户协作。既有基准主要监督用户事实与偏好或可跨用户复用的经验,把这种关系特定的智能体记忆留为隐式;且多数先前工作仅以长交互历史上的最终答案QA衡量模型,评估仍不完整不可靠。为此我们提出DyadMem及新定义——用户条件关系型智能体记忆(URAM):DyadMem沿同一多会话轨迹联合标注用户侧记忆与URAM,形成6个记忆类别;共含3065个episodes、50961个会话、61210个QA实例,附大量会话级Capture与Update金标注、查询级Recall支持,以及Gold-Memory与Full-Pipeline两种QA设置。跨16个开源与4个专有模型,Gold-Memory QA持续强劲,而全管道QA骤降——该差距明确支持我们的细粒度评估设计。多项量化结果进一步揭示:即使前沿LLM也存在捕获召回低、召回不完整与不安全删除问题。我们还以严格实验验证URAM的有效性,观察到全部20个模型的正向效应。DyadMem是双域、全管道的记忆基准,标注工作量庞大,可推动该领域发展。