论文
DynSess:角色扮演代理的动态会话级评估和优化框架
DynSess: Dynamic Session-Level Evaluation and Optimization Framework for Role-Playing Agents
摘要
使用 大语言模型 进行角色扮演从根本上来说是一项会话级任务,要求代理在扩展的多轮对话中维持角色身份和交互质量。然而,现有的评估和优化方法在很大程度上仍然是回合水平的,无法捕捉长期质量。我们提出了 DynSess,一个用于角色扮演代理的统一会话级框架。 DynSess-Eval 通过针对长期行为的评分标准对完整的对话会话进行评分。利用其会话级奖励,我们通过多轮前瞻搜索构建高质量的训练轨迹,并使用两个互补变体训练 DynSess-Character:DSPO (离策略) 和 GSRPO (同策略)。实验表明,DynSess-Eval 比之前的评估者更好地符合人类判断,并且盲人评估进一步表明,尽管使用的参数少得多,但 DynSess-Character 仍匹配最强的角色模型,同时保持强大的角色一致性和交互能力。我们的数据集和代码将被发布以促进未来的研究。