论文
从人类反馈学习个性化智能体
Learning Personalized Agents from Human Feedback
摘要
现代 AI 智能体很强大,却常难以对齐个体用户特异且不断演变的偏好。既有方法通常依赖静态数据集:或在交互历史上训练隐式偏好模型,或把用户画像存入外部记忆。然而这些方法难以应对新用户和随时间变化的偏好。我们提出 Personalized Agents from Human Feedback(PAHF),一个持续个性化框架,智能体借助显式的逐用户记忆从实时交互中在线学习。PAHF 实现三步循环:(1) 行动前询问澄清以消除歧义;(2) 依据从记忆检索的偏好落实行动;(3) 整合行动后反馈,在偏好漂移时更新记忆。为评估这一能力,我们开发了四阶段协议以及具身操作和在线购物两个基准。这些基准量化智能体从零学习初始偏好并随后适应人设转变的能力。理论分析与实证结果表明,显式记忆与双反馈通道的结合至关重要:PAHF 学习显著更快,持续优于无记忆和单通道基线,降低初始个性化误差并能快速适应偏好转变。
