论文

R$^2$A:通过角色表示学习和运行时对齐来学习角色策略

R$^2$A: Learning Persona Policies Through Persona Representation Learning and Runtime Alignment

模型训练强化学习

摘要

相同的角色行为在一种情况下可能是有益的,但在另一种情况下是有害的,导致静态角色启发在任务之间执行不一致。我们引入了角色选择-实现框架,它通过潜在角色状态对行为生成进行建模,并将其分解为角色选择和角色实现。这两个组件中静态角色启发和理想角色策略之间的差异分别定义了选择差距和实现差距。在此框架的基础上,我们提出了 R$^2$A,这是一种学习 Persona 策略的两阶段方法。角色表征学习使用结构化的“谁-如何-什么”演示来编码目标角色的目标、条件行为原则和轨迹级表现。然后,角色运行时对齐删除了显式的角色规范,并使用任务反馈联合校准行为选择和轨迹实现。在涵盖本工作中研究的负责专业角色的四个原则的 12 个评估设置中,R$^2$A 总体优于基本模型和静态角色启发。消融结果进一步表明,角色表示学习对于防止运行时对齐产生行为不平衡的策略以及实现更稳定的角色策略学习至关重要。