论文

通过言语强化学习实现 大语言模型 个性化的学习偏好适应

Learning Preference Adaptation for Large Language Model Personalization via Verbal Reinforcement Learning

上下文与知识上下文工程

摘要

自然语言用户偏好为 LLM 个性化提供了可解释的界面。然而,通用偏好摘要通常包含与特定下游任务无关的信息。因此,直接提供完整的偏好摘要会浪费上下文容量并引入跨任务干扰,而手动设计特定于任务的偏好视图则难以扩展。在这项工作中,我们研究\emph{特定于任务的偏好适应}:给定通用用户偏好摘要和下游任务,导出一个任务条件表示,该表示保留足够的决策相关证据,同时删除冗余上下文。为此,我们提出了 \textsc{AlignXada},这是一个 无需训练 元学习框架,它引入可重用的文本细化策略,以使通用偏好摘要适应特定于任务的偏好摘要。元学习器通过言语强化学习迭代优化细化策略。在 13 个任务和三个下游模型(39 个任务-模型单元)中,\textsc{AlignXada} 实现了 3.82 点的平均增益,改进了 33 个单元,同时仅保留了 22.8% 的原始配置文件标记,并在 36 个单元中优于 RAG。扩展的 忠实性 分析进一步表明,精炼的配置文件在很大程度上仍然基于源偏好,同时保留与任务相关的个性化信号,这表明配置文件侧适应可以作为终身个性化代理的通用记忆构建的实际补充。