论文

从静态个人价值到情境化个性化:面向LLM的贝叶斯个性化价值对齐

From Static Personal Values to Contextualized Personalization: Bayesian Personalized Value Alignment for LLMs

模型推理推理策略与问题分解

摘要

随着大语言模型(LLM)被期望适应多样的用户偏好,个性化价值对齐日益重要。然而,现有方法通常跨提示将模型输出与静态价值画像对齐,忽视了价值维度的显著性在不同情境下差异巨大。受Lewin场理论启发——该理论认为人类行为由个人倾向与情境约束共同塑造——我们将个人价值建模为先验,将情境依赖的偏好建模为后验。我们提出BaCVA,一种推理期的贝叶斯情境感知个性化价值对齐方法,通过整合静态个人价值与场景特定的价值显著性来近似后验个性化偏好。BaCVA首先从一般规范性回复中估计情境价值显著性,然后采用双视角个性化模块,从互补的个人价值视角与场景驱动视角推断后验偏好。这一贝叶斯表述实现了更准确、更自适应的个性化价值对齐,同时借助先验价值提升数据效率。在多个基准上的大量实验证明了其相对强基线的优越性。

从静态个人价值到情境化个性化:面向LLM的贝叶斯个性化价值对齐:论文配图
图 2:所提出的贝叶斯问题级价值建模框架概览。问题 x 提供决策上下文,用户级价值画像 v(u(i)) 调节语义个性化的方式。我们从两个互补视角学习贝叶斯残差(语义增量),并通过基于上下文的门控融合机制融合两个视角,以预测个性化、上下文感知的答案。