论文
SignMimic:通过人体形状遗忘姿势转移指导生成强大的高质量手语动作
SignMimic: Robust High-Quality Sign Language Motion Generation via Human-Shape-Oblivious Pose Transfer Guidance
摘要
我们研究手语视频模仿的挑战:给定一个驾驶视频和一个参考帧,合成一个视频,其中目标手语者再现源动作,同时保留身份和语言形式。现有的管道将刚性运动、非刚性变形和依赖于视图的完成纠缠在整体生成器中,导致手形漂移和时空不稳定。我们提出了 SignMimic,它(i)应用基于 TNet 的模型来研究 SE(3)刚性规范化以稳定全局姿势,(ii)在规范空间中执行非刚性适应以保留细粒度发音器(手/脸)并通过 NIF2D 进行协同发音,以及(iii)在条件视频扩散之前使用 Pose-MAE 式完成。这种因式分解注入了几何和语言先验,产生了形状和时空一致性。在多个大型数据集(ASL 50K、How2Sign、CSL News)上,SignMimic 在视频质量、身份相似性和帧连续性方面实现了最先进的性能,同时在生成的视频上执行反向翻译 (SLT) 时也实现了最小的损失。消融证实了严格规范化、非严格适应和完成的作用。代码、模型检查点和视频示例将被发布。