论文

FlashSign:用于高效手语视频生成的无姿势指南

FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation

应用与实践内容创作

摘要

手语在弥合聋人和听力障碍群体之间的沟通差距方面发挥着至关重要的作用。然而,现有的手语视频生成模型通常依赖于复杂的中间表示,这限制了其灵活性和效率。在这项工作中,我们提出了一种用于实时手语视频生成的新颖的无姿势框架。我们的方法通过使用基于扩散的方法直接将自然语言文本映射到手语视频,从而消除了对中间姿势表示的需要。我们引入了两项关键创新:(1)基于最先进的扩散主干的无姿势生成模型,无需姿势估计即可学习隐式文本到手势对齐;(2)可训练滑动块注意力(T-STA)机制,通过利用时空局部性模式来加速推理。与之前的 无需训练 稀疏性方法不同,T-STA 将可训练的稀疏性集成到训练和推理中,确保一致性并消除训练与测试之间的差距。这种方法显着减少了计算开销,同时保持了较高的生成质量,使实时部署变得可行。我们的方法在不影响视频质量的情况下将视频生成速度提高了 3.07 倍。我们的贡献为实时、高质量、无姿势手语合成开辟了新途径,并在面向不同社区的包容性通信工具中具有潜在应用。代码:https://github.com/AIGeeksGroup/FlashSign。