论文

从正确性到偏好:个性化代理强化学习框架

From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning

模型训练强化学习

摘要

代理强化学习(Agentic RL)在具有明确成功信号的任务中取得了巨大进展。然而,许多现实世界的代理应用程序需要用户调节的行为:相同的查询可能需要不同用户的不同规划策略和工具使用决策。这种设置提出了关键挑战:通用奖励无法捕捉异质用户偏好,观察到的行为与从众效应纠缠在一起,扁平记忆无法支持个性化技能检索。为此,我们提出了一个统一的个性化 Agentic RL 框架,将个性化嵌入到训练时优化中。其核心是\emph{个性化锚奖励解耦策略优化}(\textbf{PARPO}),它将通用任务质量奖励与个性化偏好奖励解耦,并使用特定于用户的锚来稳定异构奖励规模下的学习。我们进一步引入了两阶段偏好解缠奖励模型和 \emph{偏好对齐技能进化图记忆} (\textbf{PSGM}),用于个性化监督和偏好对齐技能检索。它们共同形成了偏好识别、政策优化和结构化技能积累的闭环。在 ETAPP、ETAPP-Hard 和 SJAgent 上的实验表明,我们的框架始终优于强记忆和 RL 基线。代码和数据包含在补充材料中。