论文
KuaiRP角色扮演模型:领域知识与通用Agent能力的平衡
KuaiRP Series Role-playing Models Technical Report
摘要
本文介绍了KuaiRP系列角色扮演模型的完整技术解决方案。我们的目标是实现专用角色扮演模型的四个核心目标:简化的提示工程、高度稳定的输出质量、内置的领域世界知识以及小参数量的高效部署。然而,有效注入深层领域知识通常会导致模型的通用代理能力发生严重的灾难性遗忘。为了克服这种权衡,我们提出了多阶段训练管道。首先,我们设计了标准化的角色模板,并构建了基于用户行为模拟和反向轮廓过滤的SFT数据管道。接下来,我们在强化学习(RL)阶段利用基于规则的复合奖励函数来消除常见的退化现象,例如长度扩展和重复生成。最后,为了恢复 SFT 和 RL 期间受损的一般能力,我们提出了一种新颖的自蒸馏范式,使用配备累积发散衰减 (CDD) 的两阶段策略蒸馏 (OPD)。通过使用领域适应模型作为教师,原始基础模型作为学生,我们有效地平衡了深层领域知识注入和通用代理能力的保留。实验结果表明,KuaiRP 模型不仅在目标域内的角色扮演保真度方面与当前最先进的专有模型相匹配,而且还成功恢复了通用代理功能,保持极低的部署成本。