论文

TurboT2VA:通过分数正则化一致性快速生成大规模文本到视频音频 蒸馏

TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

摘要

文本到视频音频的联合生成可产生同步的视觉和听觉内容,但大型模型的长采样轨迹和异构多模态计算使得推理成本极其昂贵。我们推出 TurboT2VA,这是一个 蒸馏 和推理框架,用于加速 19B 参数联合视频音频模型。大规模 T2VA 蒸馏 面临模态不平衡优化、大规模连续时间一致性训练的难度以及质量与多样性权衡的挑战。 TurboT2VA 通过按模态归一化和渐进式课程来解决这些问题,其中包括离散一致性预热、连续一致性细化和联合一致性分布匹配。课程首先建立稳定、多样化的世代轨迹,然后才引入分配层面的细化。在 LTX-2 上,四步 蒸馏 在 512$\times$768 的标准评估分辨率下将发生器延迟从 50.52s 降低至 2.51s,实现了 20.1$\times$ 加速,同时保持了强大的视觉质量、音频保真度、多样性和视频音频同步。我们进一步开发了一个架构感知推理堆栈,它结合了受保护的 W8A8 和融合运算符、填充文本压缩和模态感知稀疏注意力,同时保留密集的跨模态和文本调节路径。在 1024$\times$1792 的高分辨率部署设置下,完整堆栈将一台 NVIDIA H20 上的生成器延迟从 318.74 秒减少到 5.83 秒,仅生成器加速达到 54.67$\times$。推理代码和生成演示可在 https://github.com/thu-ml/TurboDiffusion/tree/main/turbot2va 获取。