论文

Momento:通过多会话代理对话评估持久内存和推理

Momento: Evaluating Persistent Memory and Reasoning with Multi-Session Agentic Conversations

智能体系统Agent任务评测

摘要

智能体AI的最新进展使代理能够通过工具使用、推理和多步骤规划来完成复杂的任务。然而,现有的基准在单个会话中评估代理,忽略过去的操作、陈述的偏好以及代理必须集成以实现个性化用户目标的先前决策。我们引入了 Momento,这是多会话服务环境中持久代理任务完成的基准,要求代理采取相应的、工具介导的操作,同时解决时间依赖性并跨会话发展用户目标。实验结果表明,当前代理的失败主要是由于对用户状态的错误估计,将先前的会话历史视为当前上下文的可靠代理,而不是需要重新验证的过时信息,这凸显了当前代理能力与现实的长期人机交互之间的巨大差距。