论文
奖励分解强化学习用于沉浸式视频角色扮演
Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing
摘要
基于文本的角色扮演模型可以模仿角色风格,但它们通常无法反映场景的氛围和不断变化的张力,而这对于虚拟现实 (VR) 游戏和交互式叙事等沉浸式应用程序至关重要。我们研究基于视频的角色扮演对话,并引入 EBM-RL(眼脑口强化学习),这是一种基于 GRPO 的解耦框架,明确分离观察([感知])、推理([思考])和话语([答案])。这种结构通过迫使模型首先关注视觉线索,然后形成内部解释,最后生成适合上下文的对话,从而促进类人的感官基础。 EBM-RL 集成了四种互补奖励:(i)基于 CLIP 的场景文本对齐,以改善氛围和情感; (ii) 感知认知奖励,鼓励[感知]和[思考]过程,从而增加参考反应的可能性; (iii) 回答准确性以确保忠实; (iv) 密集格式奖励,以强制实现所需的结构化输出。大量实验表明,EBM-RL 在我们的沉浸式角色扮演基准上大大优于纯文本角色扮演基线和更大规模的视觉语言模型,同时在视觉氛围一致性和角色真实性方面带来收益。除了角色扮演领域之外,EBM-RL 还表现出强大的零样本泛化能力:无需任何额外的微调,它就能持续提高域外 VideoQA 基准测试的性能。我们还发布了一个用于基于视频的角色扮演对话的开源数据集。
