论文

DRIFTLENS:测量个性化语言模型中记忆诱导的推理漂移

DRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models

模型评测上下文与知识记忆评测方法与指标Agent记忆

摘要

个性化改变模型对用户说什么;我们表明它也能改变用于支撑响应的推理轨迹。现代LLM通过存储用户属性、偏好与先前上下文个性化交互——再将这些信息注入未来提示。我们研究这种记忆是否重塑开放式问题上的推理——此类问题不存在唯一真值答案。为量化该效应,我们引入DRIFTLENS——无真值框架:将每个表达的推理步骤映射到价值类别——并测量问题的无记忆轨迹与其在注入用户属性记忆下轨迹之间的散度。我们首先验证DRIFTLENS能区分无内容的语用噪声与实质推理变化。跨四个LLM与10个用户属性类别(包括年龄、职业与残障):用户属性记忆诱发中到大幅的推理漂移——高于每个模型的语用噪声底——即使最终答案保持流畅、切题且貌似合理。我们随后评估基于GRPO与DPO的后训练方法以减少漂移。两者都减少漂移——但没有一个全面占优;对下游能力、有用性与指令遵循的影响依模型与奖励而异。这些结果表明记忆诱导的推理漂移是个性化语言模型可测量且仅被部分缓解的失败模式。

DRIFTLENS:测量个性化语言模型中记忆诱导的推理漂移:论文配图
图 1:用户记忆重塑推理。当自我描述作为上下文注入时,问题回答显示出不同的价值轨迹(S1-S3),从保护/道德责任转向情感深度/真实联系。