论文
迈向现实的个性化:评估个性化用户与大语言模型互动中的长期偏好
Towards Realistic Personalization: Evaluating Long-Horizon Preference Following in Personalized User-LLM Interactions
摘要
大语言模型 (LLM) 越来越多地充当个人助理,用户在扩展交互中共享复杂且多样化的偏好。然而,评估大语言模型在现实的长期情况下如何遵循这些偏好仍有待探索。这项工作提出了 RealPref,这是一个评估个性化用户与 LLM 交互中现实偏好遵循的基准。 RealPref 具有 100 个用户配置文件、1300 个个性化偏好、四种类型的偏好表达(从显性到隐性)以及长期交互历史记录。它包括三种类型的测试问题(多项选择、判断题和开放式),以及大语言模型法官评估的详细规则。结果表明,随着上下文长度的增长和偏好表达变得更加隐含,LLM 的性能显着下降,并且将用户偏好理解推广到未见过的场景带来了进一步的挑战。 RealPref 和这些发现为未来的研究奠定了基础,以开发具有用户意识的 LLM 助理,更好地适应个人需求。代码可在 https://github.com/GG14127/RealPref 获取。
