论文

PRAGMA:评估终身对话中记忆对齐的个性化指导

PRAGMA: Evaluating Personalized Guidance with Memory Alignment in Lifelong Conversations

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

大型语言模型 (LLM) 越来越多地被部署为个性化助手,与用户长时间交互。随着对话时间的延长,依赖完整的交互历史变得越来越低效和不可靠:长上下文会带来大量的计算开销,使得模型难以一致地识别和利用与当前请求最相关的信息。这些挑战激发了记忆系统构建和检索用户特定信息的动力。在现实交互中,用户经常寻求实用指导,例如建议、规划和决策支持。与事实回忆任务不同,个性化指导需要模型整合过去多个对话中的信息,并推理用户偏好和体验的变化。然而,现有的会话记忆评估主要集中在检索和事实回忆上。为了研究这一挑战,我们引入了 PRAGMA,这是一个评估长期对话中个性化指导的基准。 PRGAMA 包含精心策划的纵向对话历史、证据注释和基于不断变化的用户上下文和不正确的用户假设的指导场景。跨检索系统、记忆系统和长上下文模型的实验表明,当前的系统很难恢复适当的对话证据并有效地将其用于个性化指导。我们的结果强调了对记忆架构的需求,该架构支持强大的对话检索和基于记忆的推理,超越证据回忆。