论文

学习可迁移的潜在用户偏好以实现与人对齐的决策

Learning Transferable Latent User Preferences for Human-Aligned Decision Making

上下文与知识记忆Agent记忆

摘要

大语言模型(LLM)在众多应用中被越来越多地用作推理模块。尽管LLM在某些任务中效率很高,但它们往往难以产生与人对齐的解决方案。与人对齐的决策需要同时顾及明确陈述的目标,以及塑造模糊情境应如何解决的潜在用户偏好。现有的纳入此类偏好的方法要么依赖大量且反复的用户交互,要么无法将潜在偏好跨任务、跨情境地泛化,限制了其实际适用性。我们考虑这样一种设置:LLM被用于高层推理,并负责从有限的交互中推断潜在用户偏好,这些偏好进而指导下游决策。我们提出CLIPR(Conversational Learning for Inferring Preferences and Reasoning,用于推断偏好与推理的对话学习),一个从最少的对话输入中学习可操作、可迁移的自然语言规则来表示潜在用户偏好的框架。这些规则通过自适应反馈被迭代精炼,并被应用于多个环境中的分布内和分布外模糊任务。在三个数据集上的评估和一项用户研究表明,CLIPR在提升对齐度和降低推理成本方面始终优于现有方法。

学习可迁移的潜在用户偏好以实现与人对齐的决策:论文配图
图1:会话式用户偏好学习总览:偏好被归纳为可迁移的偏好规则,推理时用于回答用户。