论文
迈向鲁棒的个性化对齐:缓解多轮对话中的身份漂移
Toward Robust Personalized Alignment for LLMs: Mitigating Persona Drift in Multi-Turn Dialogue
摘要
身份漂移仍是个性化语言模型的核心挑战,因为用户画像会随长时交互动态演变,而非保持固定。模型需在用户偏好真正改变时更新持久化的人格状态,同时避免由短暂、模糊或未解决的观察驱动的更新。我们提出了CORE,将每轮对话的局部证据与持久人格状态更新分离,并通过不确定性感知的信念修正选择性地更新可验证的用户偏好。我们还引入了PERSIST,一种用于评估人格状态在连续交互压力下鲁棒性的留出后锚基准,涵盖模糊性、冲突和受控的社会影响。在ALOE、PersonaChat和PERSIST三个数据集上,CORE提升了个性化对齐和鲁棒性,并在归一化闭合槽状态保真度上取得互补增益。人类评估和机制性控制进一步表明,其在显式更新控制方面优于单纯依赖更强生成或持久记忆。
