论文
面向演化角色扮演Agent的对抗式闭环课程
Adversarial Closed-Loop Curriculum for Evolving Role-Playing Agents
摘要
基于大语言模型的角色扮演Agent已广泛应用于个性化助手与社会模拟等领域。近期的RL方法通常在学习开始前收集的固定场景池上训练。这造成了分布瓶颈:随着Agent改进,其表现不佳的场景也在变化,而训练分布保持静态。因此,我们提出AdvRole,一个对抗式上下文改写框架,将角色扮演RL转变为闭环课程。AdvRole在学习的Actor与Rewriter之间交替:Actor学习角色扮演,Rewriter将角色设定与对话上下文改写为针对Actor的困难场景。Rewriter以性能差奖励训练,偏好那些使当前Actor得分相对原始场景下降的改写。由此,场景池随Actor演化,持续瞄准角色-上下文空间中未被掌握的区域。在覆盖英文与中文的三个角色扮演基准以及我们发布的一个新多语言基准上的实验表明,AdvRole持续优于基线。
