论文

AlpsBench:用于真实对话记忆和偏好调整的 LLM 个性化基准

AlpsBench: An LLM Personalization Benchmark for Real-Dialogue Memorization and Preference Alignment

模型评测基准与评测资源

摘要

随着大语言模型(LLM)发展成为终身人工智能助手,LLM个性化已成为一个关键前沿。然而,由于缺乏金标准评估基准,目前进展受到瓶颈。现有的基准要么忽视了对个性化至关重要的个性化信息管理,要么严重依赖合成对话,而合成对话与现实世界的对话表现出固有的分布差距。为了弥补这一差距,我们引入了 AlpsBench,这是一个源自现实世界人类与 LLM 对话的 LLM 个性化基准。 AlpsBench 包含由 WildChat 策划的 2,500 个长期交互序列,与包含显式和隐式个性化信号的经过人类验证的结构化记忆配对。我们定义了四个关键任务——个性化信息提取、更新、检索和利用——并建立了评估内存管理整个生命周期的协议。我们对前沿 LLM 和以内存为中心的系统的基准测试表明:(i) 模型难以可靠地提取潜在用户特征; (ii) 即使在最强大的模型中,内存更新也面临着性能上限; (iii) 在存在大型干扰池的情况下,检索精度急剧下降; (iv) 虽然外显记忆机制可以提高回忆能力,但它们本质上并不能保证更多的偏好一致或情感共鸣反应。 AlpsBench 旨在提供一个全面的框架。