论文
PM-Bench:评估LLM智能体的前瞻记忆
PM-Bench: Evaluating Prospective Memory in LLM Agents
摘要
智能体AI的一个重大挑战是前瞻记忆:在其他活动进行的同时,在特定的未来线索或状态执行某个意图的能力。我们提出PM-Bench:一个测量现代LLM智能体前瞻记忆能力的文本基准。受认知科学虚拟周范式启发,PM-Bench评估LLM智能体维持用户意图、执行延迟意图、监测潜在环境变化的能力。在模拟的七天一周中:智能体必须在持续进行某项活动的同时判断是否有延迟任务到期。我们在八种智能体配置下比较八个最先进LLM。PM-Bench在所有设定下都具有挑战性:最佳方法(GPT-5.4智能体)在评估下仅达65.1% F1。此外,没有单一的改善前瞻记忆策略跨模型占优。我们发布PM-Bench作为受控试验台,用于诊断这些失败并开发支持可靠前瞻行为的训练或推理时干预。
