论文

PrefReward:学习用户偏好矩阵以生成个性化文本

PrefReward: Learning User Preference Matrix for Personalized Text Generation

模型推理解码与生成控制

摘要

大语言模型 (LLM) 在利用用户历史记录和上下文提示生成个性化内容方面表现出了卓越的能力。然而,大多数现有的个性化方法依赖于模型参数中的隐式表示,这使得解释用户特定的偏好或有效处理长上下文依赖性变得困难。为了应对这些挑战,我们提出了 PrefReward,这是一种新颖的偏好感知生成框架,它通过结构化偏好矩阵显式地建模用户风格,并将其作为奖励信号集成到解码过程中。 PrefReward 包含两个阶段:(1) 提取总结个人风格倾向的用户特定偏好矩阵,(2) 使用该矩阵通过基于 KL 散度的奖励函数来指导生成。 LongLaMP 数据集上的实验表明,PrefReward 在生成质量和个性化可解释性方面均优于非个性化和基于检索的基线。