论文
从静态个人价值到情境化个性化:面向LLM的贝叶斯个性化价值对齐
From Static Personal Values to Contextualized Personalization: Bayesian Personalized Value Alignment for LLMs
摘要
随着大语言模型(LLM)被期望适应多样的用户偏好,个性化价值对齐日益重要。然而,现有方法通常跨提示将模型输出与静态价值画像对齐,忽视了价值维度的显著性在不同情境下差异巨大。受Lewin场理论启发——该理论认为人类行为由个人倾向与情境约束共同塑造——我们将个人价值建模为先验,将情境依赖的偏好建模为后验。我们提出BaCVA,一种推理期的贝叶斯情境感知个性化价值对齐方法,通过整合静态个人价值与场景特定的价值显著性来近似后验个性化偏好。BaCVA首先从一般规范性回复中估计情境价值显著性,然后采用双视角个性化模块,从互补的个人价值视角与场景驱动视角推断后验偏好。这一贝叶斯表述实现了更准确、更自适应的个性化价值对齐,同时借助先验价值提升数据效率。在多个基准上的大量实验证明了其相对强基线的优越性。
