论文
在 LLM 个性化中重新以人类为中心
Re-Centering Humans in LLM Personalization
摘要
尽管人们的兴趣日益浓厚,但大多数对 大语言模型' (LLM') 个性化能力的评估都依赖于合成数据。目前还不清楚当前的个性化系统对真实用户的效果如何。在本文中,我们研究了使用合成数据与人类数据时 LLM 个性化性能的差距。我们收集了个性化三个阶段的人类对话(550 个对话)和判断:从对话中提取用户属性(5,949 个判断),将相关属性与新提示配对(11,919 个),以及将相关属性合并到个性化响应中(1,101 个)。结合人类数据揭示了每个阶段的系统局限性。模型很难从人类对话中提取属性,不同意人类对相关属性的判断,并生成人类认为不比通用响应更好的个性化响应(尽管 LLM 判断普遍认为更好)。我们引入了两种基于训练的轻量级干预措施,使自动个性化评估在前两个阶段更接近人类数据。然而,在我们的第三阶段,我们发现学习奖励模型与人类评分仅实现适度的相关性,这表明与人类一致的个性化质量判断很难直接建模。我们收集的数据为研究模型如何以人类认为有用的方式提取、选择和合并用户信息奠定了基础。