论文

迈向定制化多模式角色扮演

Towards Customized Multimodal Role-Play

模型训练强化学习

摘要

统一的多模态理解和生成模型可实现更丰富的人机交互。然而,在保持跨模式输出一致性的同时,共同定制角色的角色、对话风格和视觉形象,这在很大程度上仍未得到探索。为了缩小这一差距,我们引入了一项新任务:定制多模式角色扮演(CMRP)。我们构建了包含 20 个角色的 RoleScape-20 数据集,包括涵盖角色、风格描述、视觉/表达线索和文本图像交互的训练和评估数据。在统一模型的基础上,我们设计了 UniCharacter,这是一个两阶段训练框架,包含统一监督微调(Unified-SFT)和特定角色组相对策略优化(Character-GRPO)。仅给定 10 个图像加上相应的交互示例,该模型即可获取目标角色,并在生成的文本和图像中展现连贯的角色、风格和视觉识别。此过程大约需要 100 个 GPU 小时。 RoleScape-20 数据集上的实验表明,所提出的方法大大优于先前的方法。消融研究进一步验证了我们的跨模式一致性设计和少样本定制策略的有效性。我们认为 CMRP 与统一建模相结合,为下一代个性化和沉浸式交互代理提供了基础。