论文
EMOSH:人类动画的表现力运动和形状解开
EMOSH: Expressive Motion and Shape Disentanglement for Human Animation
摘要
高保真、富有表现力的可控人体动画对于内容创作和数字化身应用至关重要。然而,现有的方法面临着表达性和解开性之间的困境。主流的 2D 姿态调节方法遭受“运动形状纠缠”的困扰,导致驾驶主体的身体形状泄漏。相反,依赖 3D 先验的方法(例如 SMPL)实现了几何解缠,但难以捕捉面部表情和复杂手势,从而导致动画僵化。为此,我们提出了 EMOSH,一种用于高保真可控人类视频生成的新颖框架。首先,引入表达人类模型(EHM)作为核心控制表示。通过明确地解开形状和姿势参数,我们从根本上解决了身体形状泄漏问题。除此之外,还设计了一个强大的运动跟踪器来准确估计视频中的 EHM 参数。其次,我们提出了一种从粗到细的混合运动注入策略,可以对表情和手势进行更细粒度的控制。此外,我们引入了空间对齐调节机制来弥合训练和推理之间的领域差距,从而提高身份一致性。大量实验表明,EMOSH 在自驱动和交叉驱动场景中都优于以前的方法,在保持形状解缠结的同时,生成表情生动的高保真视频。