论文

CRPO:角色扮演代理中角色感知推理的以角色为中心的组相对策略优化

CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents

模型训练强化学习

摘要

强化学习(RL)的最新进展,特别是组相对策略优化(GRPO),显着增强了 大语言模型 的推理能力。然而,将这些以问题为中心的优化方法应用于角色扮演代理通常会导致角色保真度的丧失和风格崩溃,因为它们优先考虑上下文特定的实用性而不是角色对齐。为了解决这个问题,我们提出了以角色为中心的群体相对策略优化(CRPO),这是一个旨在重新调整强化学习目标与角色扮演任务的框架。 CRPO 通过三种机制提高角色独特性:将任务逻辑与风格奖励解耦以解决梯度冲突,根据角色复杂性动态调整优化约束,以及利用通用响应作为负基线以防止模型恢复到常见分布。大量实验表明,CRPO 在一致性、情感等方面优于现有方法。