论文

迈向现实的个性化:评估个性化用户与大语言模型互动中的长期偏好

Towards Realistic Personalization: Evaluating Long-Horizon Preference Following in Personalized User-LLM Interactions

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

大语言模型 (LLM) 越来越多地充当个人助理,用户在扩展交互中共享复杂且多样化的偏好。然而,评估大语言模型在现实的长期情况下如何遵循这些偏好仍有待探索。这项工作提出了 RealPref,这是一个评估个性化用户与 LLM 交互中现实偏好遵循的基准。 RealPref 具有 100 个用户配置文件、1300 个个性化偏好、四种类型的偏好表达(从显性到隐性)以及长期交互历史记录。它包括三种类型的测试问题(多项选择、判断题和开放式),以及大语言模型法官评估的详细规则。结果表明,随着上下文长度的增长和偏好表达变得更加隐含,LLM 的性能显着下降,并且将用户偏好理解推广到未见过的场景带来了进一步的挑战。 RealPref 和这些发现为未来的研究奠定了基础,以开发具有用户意识的 LLM 助理,更好地适应个人需求。代码可在 https://github.com/GG14127/RealPref 获取。

迈向自然个性化:评估个性化用户-LLM 交互中的长程偏好遵循
图2:生成流水线概览。从用户人设(persona)出发,我们构建详细的用户画像与生平,并生成多样的偏好。基于画像与偏好,我们构建丰富的对话会话以模拟用户–LLM交互动态,涵盖从显式到隐式的偏好表达。这些会话被拼接为每个用户的长程上下文。针对每种偏好,我们设计了配套评估方法的生成与分类任务。