论文

EpiPersona:面向多元偏好建模的人格投射与情景耦合

EpiPersona: Persona Projection and Episode Coupling for Pluralistic Preference Modeling

模型训练奖励建模与过程监督

摘要

多元对齐对于让大语言模型(LLM)适应个体与少数群体的多样化偏好至关重要。然而,现有方法常常将稳定的个人特质与特定情景因素混在一起,限制了其跨情景泛化的能力。为应对这一挑战,我们提出EpiPersona,一个显式人格-情景耦合框架。EpiPersona首先将带噪声的偏好反馈投射到低维人格空间,在其中将相似的人格聚合为共享的离散编码。这一过程在无需依赖预定义偏好维度的情况下,将持久的个人特征与情境信号分离。随后,推断出的人格表示与当前情景耦合,实现情景感知的偏好预测。大量实验表明,EpiPersona持续优于各基线。它在困难的情景漂移场景中取得显著性能提升,同时在稀疏偏好数据下依然有效。

EpiPersona:面向多元偏好建模的人格投射与情景耦合:论文配图
图 1:我们提出 EpiPersona,它首先将偏好反馈空间 XX 映射到角色空间 𝒵p\mathcal{Z}_{p}。根据个人的历史偏好信息,我们对个人的潜在角色 ZuZ_{u} 进行建模。我们进一步介绍了 EpiPersona 的两个变体,将角色 ZuZ_{u} 与情节上下文 ee 结合起来进行偏好预测:EpiPersona-A,专门用于以即插即用的方式推断个人特定于情节的偏好;EpiPersona-B,专为多元奖励学习而设计。