论文
ReFree:通过无奖励强化学习和多级语音指导实现真实的共同语音视频生成
ReFree: Towards Realistic Co-Speech Video Generation via Reward-Free RL and Multilevel Speech Guidance
摘要
语音驱动的说话角色动画旨在生成栩栩如生的肖像视频,传达自然的对话行为,使面部动作与语音音频保持一致。尽管视频生成方面的最新进展极大地提高了基于视频的动画的真实感,但实现准确的唇部发音和表现行为仍然具有挑战性。现有的方法通常会权衡精确的音素到嘴唇的同步与动态面部表情和头部运动,产生的动画要么准确但僵化,要么富有表现力但同步性较差。我们通过提出 ReFree-S2V 来应对这一挑战,这是一种流程匹配的语音到肖像动画框架,该框架基于预训练的视频生成模型,以在语音驱动的肖像动画中实现细粒度的语音清晰度和高级表达线索。该模型引入了多级语音表示,捕获本地和全局粒度的语音和韵律信息。这些表示通过可学习的级别选择器有选择地注入到 Transformer 模块中,从而实现准确的唇形同步和自然的表达动作。为了实现自然的头部运动,我们进一步在流匹配训练中引入一种新颖的无奖励强化学习方案,以阻止感知上不可信的运动,而不依赖于手工制作的同步指标或奖励模型,或人类偏好注释的高成本。大量实验表明,ReFree-S2V 实现了最先进的性能,在定量唇形同步精度以及对自然性和表现力的定性人类评估方面均显着优于现有方法。