论文

SignRefine:采用基础视频模型来生成手语

SignRefine: Adapting Foundational Video Models for Sign Language Generation

应用与实践内容创作

摘要

手语视频的生成需要精确的手部和面部清晰度,但主要在口语视频上训练的现代视频传播模型会产生导致手语难以理解的伪影。我们提出了 SignRefine,这是一种手语视频生成模型,仅通过 2D 关键点调节即可生成可理解的手语,并概括了外观和视觉条件。我们的方法建立在预训练的视频扩散 Transformer 的基础上,并引入了具有空间基础的本地适配器,以选择性地细化手部和面部区域,从而引导强大的基础模型先验以实现准确的清晰度。为了开展这项工作并支持更广泛的手语研究,我们推出了 NVSign,这是一个以手语原生制作的大规模视频内容数据集,提供了不同的手语者外观、环境和自然对话设置。根据这些数据进行训练,我们的模型显示手部姿势精度指标比最强基线提高了 30%,并且在超过 80% 的比较中因其视觉质量和可理解性而受到手语用户的青睐。