论文
通过基于心理学的推理和角色感知策略优化改进通用角色扮演代理
Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization
摘要
构建能够忠实地描绘自然语言轮廓中的任何角色的通用角色扮演代理仍然具有挑战性。主导范式——受监督的 微调——鼓励行为模仿,但没有深入的、类似人类的内部思维过程,导致分布外泛化能力较差。因此,我们提出 \textbf{Psy-CoT},一个基于心理学的思想链框架,它将预反应推理分解为三个特定于角色的步骤 - \emph{交互感知}、\emph{心理移情} 和 \emph{逻辑构建} - 以便模型 \emph{从侧面动态思考},而不是仅仅模仿表面模式。虽然结构化推理提供了基础,但仅靠它还不够。强化学习对于进一步使模型与角色保真度保持一致至关重要。然而,我们观察到,在基于 LLM 的奖励模型下,破解奖励模型的通用短语和真正特定于角色的短语都会收到相同的梯度信号——这种黑客行为会在训练中累积,误导模型将两者视为同等的最佳选择。为了解决这个问题,我们提出\textbf{角色感知策略优化(RAPO)},它使用配置文件 - 词元互信息来不对称地加权梯度 - 在积极优势下放大特定于角色的词元,同时在消极优势下削弱它们。 CoSER、CharacterBench 和 CharacterEval 上的实验表明,Psy-CoT 优于现有的角色扮演 CoT 方法,而 RAPO 在多个模型尺度上始终优于 GRPO。