论文
自我监督的个性化用户配置文件生成
Self-supervised User Profile Generation for Personalization
摘要
个性化 大语言模型 (LLM) 已成为一项核心挑战,因为 LLM 部署在推荐、搜索、对话和内容生成中,在这些设置中,相同的查询应该针对不同的用户产生不同的答案。一个有前途的途径是将每个用户的交互历史记录总结为自然语言记忆或配置文件,并将其添加到提示中以促进个性化。现有的方法通过从标记的下游任务中获得的显式奖励来学习此类配置文件生成器,这些奖励昂贵且稀疏,因为它们需要对每个目标任务进行带注释的监督。鉴于这一挑战,我们引入了通过配置文件进行双向用户建模(BUMP),这是一种自我监督框架,可以在没有任何下游标签的情况下训练配置文件生成器。具体来说,给定用户的交互历史记录,我们使用 GRPO 训练 LLM,使其在双向批内排名目标下发出自由格式的文本配置文件:一个小型 LLM 法官测量(i)生成的配置文件(用作查询)将用户自己的保留交互排名在批次中其他用户的交互之上的效果如何,以及(ii)用作查询的保留交互对用户的交互进行排名的效果如何自己的个人资料高于其他用户的个人资料。两个方向均采用多正 NDCG 进行评分,并在每次执行轨迹时组合成密集奖励;批次中的其他用户提供免费的底片,因此每个训练示例仅从原始交互日志中产生监督。根据 LaMP 基准进行评估,BUMP 匹配或优于闭源 API 和依赖标记奖励的先前方法,同时在训练时不需要任务标签。