论文

PERMA:基于事件驱动偏好与真实任务环境的个性化记忆智能体基准

PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

为大语言模型提供长期记忆对于构建适应用户不断变化的需求的代理至关重要。然而,先前的评估通常会将与偏好相关的对话与不相关的对话交织在一起,从而将任务简化为大海捞针,同时忽略了驱动用户偏好演变的事件之间的关系。这些设置忽略了现实世界个性化的一个基本特征:偏好逐渐出现并在嘈杂环境中的交互中积累。为了弥补这一差距,我们引入了 PERMA,这是一个旨在评估角色随着时间的推移超出静态偏好回忆的一致性的基准。此外,我们结合(1)文本变异性和(2)语言对齐来模拟现实世界数据中不稳定的用户输入和个人习惯。 PERMA 由跨多个会话和域的按时间排序的交互事件组成,并随时间插入与偏好相关的查询。我们设计了多项选择和交互任务来探索模型对交互时间轴上角色的理解。实验表明,通过链接相关交互,先进的记忆系统可以提取更精确的偏好并减少token消耗,优于原始对话的传统语义检索。尽管如此,他们仍然难以在时间深度和跨域干扰上保持一致的角色,这凸显了代理中需要更强大的个性化内存管理。我们的代码和数据在 https://github.com/PolarisLiu1/PERMA 上开源。

PERMA:基于事件驱动偏好与真实任务环境的个性化记忆智能体基准:论文配图
图 1. 上下文构建和评估的比较。 (左)现有基准:通过稀疏的“大海捞针”检索来评估孤立的偏好。 (右)PERMA:实现了事件驱动的范例,其中偏好随时间和跨会话进行整合,以评估记忆系统的功能。