论文

奖励分解强化学习用于沉浸式视频角色扮演

Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing

模型训练强化学习

摘要

基于文本的角色扮演模型可以模仿角色风格,但它们通常无法反映场景的氛围和不断变化的张力,而这对于虚拟现实 (VR) 游戏和交互式叙事等沉浸式应用程序至关重要。我们研究基于视频的角色扮演对话,并引入 EBM-RL(眼脑口强化学习),这是一种基于 GRPO 的解耦框架,明确分离观察([感知])、推理([思考])和话语([答案])。这种结构通过迫使模型首先关注视觉线索,然后形成内部解释,最后生成适合上下文的对话,从而促进类人的感官基础。 EBM-RL 集成了四种互补奖励:(i)基于 CLIP 的场景文本对齐,以改善氛围和情感; (ii) 感知认知奖励,鼓励[感知]和[思考]过程,从而增加参考反应的可能性; (iii) 回答准确性以确保忠实; (iv) 密集格式奖励,以强制实现所需的结构化输出。大量实验表明,EBM-RL 在我们的沉浸式角色扮演基准上大大优于纯文本角色扮演基线和更大规模的视觉语言模型,同时在视觉氛围一致性和角色真实性方面带来收益。除了角色扮演领域之外,EBM-RL 还表现出强大的零样本泛化能力:无需任何额外的微调,它就能持续提高域外 VideoQA 基准测试的性能。我们还发布了一个用于基于视频的角色扮演对话的开源数据集。

奖励分解强化学习用于沉浸式视频角色扮演
图 1:从静态角色到情境一致性。当前的纯文本角色扮演模型(路径 A)是“气氛盲”的,尽管面临危机,但仍严格遵循幽默。相比之下,我们基于沉浸式视频的方法(路径 B)感知视觉张力(例如巨型蜘蛛),并动态地将行为从幽默转变为克制,确保角色在高风险环境中正确行事。