论文

StreamMemBench:面向未来导向助手任务的智能体记忆流式评估

StreamMemBench: Streaming Evaluation of Agent Memory for Future-Oriented Assistance

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

个人代理记忆的核心作用是将存储的信息和先前的交互转化为面向未来的帮助。在日常使用中,有用的线索来自代理观察到的内容以及用户如何与代理交互,并且代理必须将它们从当前请求转移到类似的未来任务。现有的记忆基准通常单独测试对话回忆或任务改进,而从流式观察到后来的帮助的轨迹在很大程度上未经测试。我们引入了 StreamMemBench,这是一个流基准,它围绕来自 EgoLife 自我中心流的每个证据锚构建一个两步任务序列。初始任务测试证据使用,而后续任务测试反馈和交互经验是否被重用。四个指标用于诊断证据回忆、初始证据使用、反馈合并和后续重用。对跨两个主干的八个记忆系统进行的实验表明,当前的系统通常无法使用观察到的证据或将反馈转化为可靠的后续行为,即使证据已存储或反馈已在本地合并。 StreamMemBench 可在 https://github.com/landian60/StreamMemBench 上公开获取。

StreamMemBench:面向未来导向助手任务的智能体记忆流式评估:论文配图
图 1:个人代理内存的流视图。存储系统从以自我为中心的流中识别并存储与用户相关的信息以支持初始任务。然后,它存储所产生的交互,包括用户反馈,以支持相关后续任务的未来帮助。