论文

面向演化角色扮演Agent的对抗式闭环课程

Adversarial Closed-Loop Curriculum for Evolving Role-Playing Agents

模型训练强化学习Agentic RL

摘要

基于大语言模型的角色扮演Agent已广泛应用于个性化助手与社会模拟等领域。近期的RL方法通常在学习开始前收集的固定场景池上训练。这造成了分布瓶颈:随着Agent改进,其表现不佳的场景也在变化,而训练分布保持静态。因此,我们提出AdvRole,一个对抗式上下文改写框架,将角色扮演RL转变为闭环课程。AdvRole在学习的Actor与Rewriter之间交替:Actor学习角色扮演,Rewriter将角色设定与对话上下文改写为针对Actor的困难场景。Rewriter以性能差奖励训练,偏好那些使当前Actor得分相对原始场景下降的改写。由此,场景池随Actor演化,持续瞄准角色-上下文空间中未被掌握的区域。在覆盖英文与中文的三个角色扮演基准以及我们发布的一个新多语言基准上的实验表明,AdvRole持续优于基线。

面向演化角色扮演Agent的对抗式闭环课程:论文配图
图 1:现有方法与 AdvRole 的比较。现有方法在训练前收集的固定场景池上训练 Actor;相比之下,AdvRole 引入一个 Rewriter,持续编辑角色设定与对话上下文以暴露 Actor 的失败,使场景池在整个训练过程中不断演化。