论文

通过交互了解用户偏好以实现长期协作

Learning User Preferences Through Interaction for Long-Term Collaboration

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

随着会话代理积累与用户协作的经验,适应用户偏好对于培养长期关系和随着时间的推移提高协作质量至关重要。我们引入了 MultiSessionCollab,这是一个基准,用于评估代理如何了解用户偏好并利用它们来提高多个会话中的协作质量。为了开发在这种情况下取​​得成功的代理,我们提出了长期协作代理,其配备了随着交互经验积累而持续并完善用户偏好的记忆。此外,我们证明学习信号可以从 MultiSessionCollab 中的用户模拟器行为中导出,以训练代理生成更全面的反射并更有效地更新其记忆。大量实验表明,为代理配备内存可以改善长期协作,提高任务成功率,提高交互效率,并减少用户工作量。最后,我们进行了一项人类用户研究,证明记忆有助于改善现实环境中的用户体验。

MultiSessionCollab:利用记忆学习用户偏好以改进长期协作 配图
图 2:用于改进会话级反思的 RL 框架。策略模型为一个会话生成 n 个反思 rollout。评判模型针对 ε(用于强制执行偏好的用户话语子集)评估每个反思并分配奖励。随后计算优势,并通过 GRPO 更新策略。