论文
通过 LLM 个性化的概率偏好基础进行不确定性感知变分奖励分解
Uncertainty-Aware Variational Reward Factorization via Probabilistic Preference Bases for LLM Personalization
摘要
奖励分解通过将奖励分解为共享基础函数和用户特定的权重来个性化 大语言模型 (LLM)。然而,现有方法从孤立的稀缺数据中估计用户权重并作为确定点,导致推断不准确且不可靠。我们引入了变分奖励分解(VRF),这是一种不确定性感知框架,它将每个用户的偏好表示为共享偏好空间中的变分分布。 VRF 通过变分编码器推断用户分布,通过与共享概率基的 Wasserstein 距离匹配导出权重,并通过方差衰减损失降低不确定估计的权重。在三个基准测试中,VRF 在见过和未见过的用户、少数场景以及不同的不确定性水平方面都优于所有基准,并且收益延伸到了下游对齐。我们的代码位于 https://github.com/Gyu-Seok-Lee/VRF_COLM26。