论文

Setoka:面向异构数据个性化智能体的分层用户理解基准

Setoka: A Benchmark for Hierarchical User Understanding in Personalized Agents over Heterogeneous Data

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

个性化智能体正被越来越多地应用于协助用户完成各类任务。有效的个性化辅助不仅需要从智能体记忆所存储的过往交互中检索显式事实,还需要推断抽象的个人特征。然而,现有记忆基准主要评估智能体能否检索会话历史中明确陈述的信息,无法对更深层次的用户理解提供有效评估。在本工作中,我们提出Setoka,一个评估记忆增强型个性化智能体对异构数据进行分层用户理解的基准。Setoka扎根于认知心理学与人格心理学理论,定义了四个层级的用户理解,即语义记忆、情景记忆、行为模式和人格特质。此外,为实现真实且保护隐私的评估,我们设计了基于心理测量学的流水线,可大规模合成多样且连贯的异构用户数据与查询。最后,我们利用Setoka评估了3个语言模型与5个记忆系统在10个合成用户上的组合。我们的全面评估显示,尽管现有系统在语义记忆检索上表现良好,其在情景记忆上的表现出现下滑。此外,在处理需要整合随时间分散的异构碎片信息的行为模式与人格特质理解任务时,性能下滑更为严重。这些发现表明,用户理解无法靠简单的事实检索来解决,这促使人们设计能够对长期用户行为进行跨源整合与抽象的记忆机制。

Setoka:面向异构数据个性化智能体的分层用户理解基准:论文配图
图 1:濑户卡市概况。左:Setoka 生成的用户档案涵盖从抽象的个性特征到具体的语义记忆,支持四个级别的用户理解。然后,这些配置文件用于生成每个级别的异构用户数据和查询。右:每个级别的代表性问题。随着用户理解水平的提高,回答相应的问题需要整合来自更广泛的用户数据的证据。底部:生成的异构记录被序列化并由正在评估的内存系统消耗以构建其内存。为了回答用户的查询,代理从内存中检索相关信息并使用它来生成响应。