论文

GDPO-Listener:通过自回归流量匹配和组奖励解耦策略优化生成富有表现力的交互式头

GDPO-Listener: Expressive Interactive Head Generation via Auto-Regressive Flow Matching and Group reward-Decoupled Policy Optimization

应用与实践内容创作

摘要

为二元交互生成逼真的 3D 头部运动是虚拟人体合成中的一个重大挑战。虽然最近的方法在头部说话方面取得了令人印象深刻的结果,但它们经常遇到听众运动中的“均值回归”问题,陷入静态面部,并且缺乏复杂非语言运动的参数空间。在本文中,我们提出了 GDPO-Listener,这是一种新颖的框架,可以实现高度表现力的口语和听力动作生成。首先,我们引入了一种自回归流匹配架构,可实现稳定的监督学习。其次,为了克服运动静止,我们应用了群体奖励解耦策略优化(GDPO)。通过隔离不同 FLAME 参数组的奖励标准化,GDPO 明确激励高方差表达世代。最后,我们为可定制的响应启用显式语义文本控制。对无缝交互和 DualTalk 数据集的广泛评估表明,与现有基线相比,在长期运动学方差、视觉表现力和语义可控性方面具有卓越的性能。