论文

用于个性化评估的偏好感知量规学习

Preference-Aware Rubric Learning for Personalized Evaluation

模型评测评测方法与指标

摘要

随着 大语言模型 (LLM) 从通用助手发展到以用户为中心的代理,个性化已成为使模型行为与个人偏好保持一致的核心,使得个性化对齐的评估成为关键瓶颈。现有的评估方法(从自动指标到 LLM 作为法官的方法)无法捕获长期交互历史中嵌入的主观的、特定于用户的偏好。我们确定了可靠且有效的个性化评估的三个基本原则:代表性、用户一致性和歧视性。为了解决这些原则,我们引入了个性化评估作为学习,这是一种将个性化评估制定为学习问题而不是静态判断的范式。在这种范式下,我们提出了 PARL(用于个性化评估的偏好感知评分标准学习),该框架学习直接从原始用户历史中引入偏好感知评估评分标准,并执行自我验证机制以确保与用户偏好的一致性。 PARL 将评分规归纳与判别性强化学习目标相结合,将用户编写的响应与竞争性个性化模型输出进行对比,使学习的评分规能够捕获精确的、特定于用户的决策边界。对现实世界个性化文本生成任务的实验表明,PARL 始终能够产生高保真度的评分标准,能够可靠地识别用户一致的响应并在用户和任务之间进行泛化,同时捕获稳定的风格偏好和细粒度的评估模式。为了确保可重复性,我们的代码可从 https://github.com/SnowCharmQ/PARL 获取。