论文

PDEU-Bench:工具调用 LLM Agent的个性化规划生命周期基准测试

PDEU-Bench: Benchmarking the Personalized Planning Lifecycle of Tool-Calling LLM Agents

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

大语言模型 (LLM) Agent正在从执行独立指令的工具调用系统发展为通过持续的多步骤交互来追求用户目标的面向任务的Agent。然而,现有的个性化工具使用基准主要评估孤立的调用或反应性执行,从而不清楚Agent是否可以制定、执行和修改明确的计划,同时在整个长期交互过程中保留用户偏好。为了解决这一差距,我们引入了 \textbf{PDEU-Bench} (\textbf{P}个性化计划 \textbf{D}efinition、计划 \textbf{E}xecution 和计划 \textbf{U}pdate \textbf{Bench}mark),这是一个用于评估个性化工具使用Agent的完整规划生命周期的基准。 PDEU-Bench 包含 214 项长期交互任务,涵盖 12 个日常领域和 94 个工具,并对偏好遵守情况和计划质量进行特定阶段的评估。对 15 个具有代表性的开源和闭源LLM的广泛评估揭示了本地工具执行和动态规划之间的明显差距:LLM通常可以在单独的调用中实例化偏好,但难以构建连贯的计划定义和计划更新。我们进一步评估主流个性化和记忆增强方法。尽管这些方法改进了特定阶段,但所评估的方法都没有在整个生命周期中可靠地传播用户偏好,并且它们的收益经常无法转移到后续执行。细粒度的错误分析进一步揭示了偏好遗漏和冲突在整个规划生命周期中持续存在,突出表明未来研究需要通过偏好感知信息检索和记忆功能来参数化LLM。我们在附录中提供了相关代码和数据以支持未来的研究。