论文

PM-Bench:评估LLM智能体的前瞻记忆

PM-Bench: Evaluating Prospective Memory in LLM Agents

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

智能体AI的一个重大挑战是前瞻记忆:在其他活动进行的同时,在特定的未来线索或状态执行某个意图的能力。我们提出PM-Bench:一个测量现代LLM智能体前瞻记忆能力的文本基准。受认知科学虚拟周范式启发,PM-Bench评估LLM智能体维持用户意图、执行延迟意图、监测潜在环境变化的能力。在模拟的七天一周中:智能体必须在持续进行某项活动的同时判断是否有延迟任务到期。我们在八种智能体配置下比较八个最先进LLM。PM-Bench在所有设定下都具有挑战性:最佳方法(GPT-5.4智能体)在评估下仅达65.1% F1。此外,没有单一的改善前瞻记忆策略跨模型占优。我们发布PM-Bench作为受控试验台,用于诊断这些失败并开发支持可靠前瞻行为的训练或推理时干预。

PM-Bench:评估LLM智能体的前瞻记忆:论文配图
图 1:PM-Bench 概述。该基准将虚拟周范式改编为为期 7 天的基于文本的时间表,其中大语言模型代理人必须在正确的未来时间或事件执行推迟的意图,同时继续正在进行的活动。我们提出了一系列竞争基线,试图解决 PM-Bench 问题并揭示不同代理设置面临的关键挑战。