论文

OSPD:基于策略的自我蒸馏以实现角色一致的对话

OSPD: On-Policy Self-Distillation for Persona-Consistent Dialogue

摘要

在多轮对话中保持角色一致性仍然是角色扮演语言模型的核心挑战。来自外部教师的离策略蒸馏会导致分布不匹配,这种不匹配会在对话轮次中加剧,而强化学习则与主观角色保真度中固有的奖励模糊性作斗争。我们提出了 OSPD,一种在策略自我蒸馏框架,其中相同的模型在不对称信息下既充当教师又充当学生:教师收到完整的角色概况,而学生只能看到简短的摘要,学生根据自己的策略生成轨迹。我们发现教师对角色扮演对话的信心呈现出双峰结构——在角色关键标记处急剧达到峰值,但在通用话语处扩散——并引入角色感知分歧切换来匹配这种结构。渐进的特质掩盖课程进一步迫使性格知识沿着语义维度分阶段内化。 CharacterBench、CharacterEval 和 SocialBench 上的实验表明,与监督微调和多轮 RL 基线相比,OSPD 显着提高了角色一致性,而无需任何外部教师或奖励模型。