论文

Mem2ActBench:评测Agent能否用长期记忆正确调用工具

Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents

智能体系统上下文与知识记忆Agent 工具调用Agent任务评测Agent记忆

摘要

基于大语言模型的Agent越来越多地执行复杂工具任务,长期记忆对驱动动作至关重要。然而,现有基准主要检查Agent能否根据明确问题被动找回孤立事实,未能评测主动应用记忆完成任务这一更关键的能力。为弥补这一缺口,本文提出Mem2ActBench,评测Agent能否主动使用长期记忆选择适当工具,并根据记忆确定工具参数。基准模拟持续使用的助手:用户在漫长且被打断的交互中多次提及同一主题,并期待助手自动沿用已经确定的偏好和任务状态。数据流水线整合ToolACE、BFCL与Oasst1等异构来源,通过一致性建模消解冲突,生成2,029个会话,每个会话平均包含12轮用户、助手与工具交互。基于这些记忆链,反向生成方法构造400项工具任务;人工评估确认91.3%的任务高度依赖记忆。对七种记忆框架的实验表明,现有系统仍难以主动利用记忆确定工具参数,需要更有效的评测与改进方法。

Mem2ActBench:评测Agent能否用长期记忆正确调用工具 配图
图1:找回事实与利用记忆执行工具任务的区别。