论文

从人类反馈学习个性化智能体

Learning Personalized Agents from Human Feedback

上下文与知识记忆Agent记忆

摘要

现代 AI 智能体很强大,却常难以对齐个体用户特异且不断演变的偏好。既有方法通常依赖静态数据集:或在交互历史上训练隐式偏好模型,或把用户画像存入外部记忆。然而这些方法难以应对新用户和随时间变化的偏好。我们提出 Personalized Agents from Human Feedback(PAHF),一个持续个性化框架,智能体借助显式的逐用户记忆从实时交互中在线学习。PAHF 实现三步循环:(1) 行动前询问澄清以消除歧义;(2) 依据从记忆检索的偏好落实行动;(3) 整合行动后反馈,在偏好漂移时更新记忆。为评估这一能力,我们开发了四阶段协议以及具身操作和在线购物两个基准。这些基准量化智能体从零学习初始偏好并随后适应人设转变的能力。理论分析与实证结果表明,显式记忆与双反馈通道的结合至关重要:PAHF 学习显著更快,持续优于无记忆和单通道基线,降低初始个性化误差并能快速适应偏好转变。

从人类反馈学习个性化智能体
图1:静态与持续个性化对比。上:静态个性化,离线的人机交互日志被一次性处理以填充用户画像,部署时智能体仅从这一静态记忆中读取。下:我们的持续个性化框架让用户在在线交互过程中保持在环:智能体在动作前阶段查阅并更新显式记忆,用户在智能体行动后观察环境中的结果并提供动作后反馈,该反馈被写回记忆,以纠正错误并随偏好变化进行适应。