论文

VitaBench 2.0:评估长期用户交互中的个性化与主动式智能体

VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

大语言模型(LLM)已演进为在真实任务中与用户协作的交互式智能体。在这种场景下,有效的协作越来越依赖于超越显式表述来理解用户,因为用户意图往往体现在碎片化的日常交互中,既需要个性化建模也需要主动式交互。然而,现有智能体基准主要评估推理与工具使用,在很大程度上忽视了在真实场景中推断并利用用户偏好的挑战。为填补这一空白,我们提出VitaBench 2.0,一个用于评估长期用户交互中个性化与主动式智能体行为的基准。在VitaBench 2.0中,任务被组织为针对单个用户的时间有序序列,偏好嵌入在碎片化且异构的交互之中。成功完成任务要求智能体从这些交互中持续提取、利用并更新用户偏好。我们还通过要求智能体在决策前识别缺失信息并主动向用户或环境获取该信息的任务来评估主动性。为支持系统化分析,我们提供了一个可扩展的记忆接口,使不同记忆架构之间能够进行受控比较。我们对多样的前沿专有与开源LLM进行了基准评测。结果显示,即使对最先进的模型而言,真实世界的个性化仍然极具挑战,揭示出当前能力与实际需求之间的显著差距。深入分析进一步揭示了当前智能体在真实个性化决策中的失败模式与能力瓶颈,为未来的模型改进提供了洞见。

VitaBench 2.0:评估长期用户交互中的个性化与主动式智能体:论文配图
图 1:VitaBench 2.0 概述。代理需要对每个用户的时间任务序列进行操作,从碎片化的交互中推断不断变化的用户偏好,通过记忆机制维护这些偏好,并做出个性化和主动的决策。