论文

HoliDubber:通过文本引导音频合成对复杂声学场景进行整体视频配音

HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis

应用与实践内容创作

摘要

视频配音是多媒体内容创作的基石,旨在为视觉流合成同步的声音序列。虽然文本转语音(TTS)和文本转音频(TTA)生成都取得了显着的进步,但现有的配音系统仍然局限于孤立的语音合成,没有结合音效和环境音频,迫使从业者依赖碎片化的工作流程和费力的手动后期混音。为了解决这一限制,我们推出了 HoliDubber,这是一种整体视频配音框架,它超越了仅生成语音的范畴,能够从单个文本提示中联合合成语音和声音效果。具体来说,HoliDubber 采用基于补丁的自回归扩散 Transformer 架构,其中因果语言模型对聚合补丁嵌入进行自回归建模以捕获全局时间结构,并且扩散 Transformer 解码器遵循分而治之策略在每个补丁内生成高保真连续词元。为了实现跨模态对齐,视觉特征被编码为补丁级表示,并通过交叉注意力与音频补丁融合,使模型能够在说话者的视觉清晰度动态中生成语音。此外,我们还推出了 HoliDub-Bench,这是一个根据已建立的数据集策划的基准,其中包含同步的视频-文本-音频三元组,专为整体配音评估而设计。大量实验表明,HoliDubber 在语音质量、同步性和说话人相似性方面的多个基准测试中显着优于现有方法。此外,HoliDub-Bench 的结果验证了联合语音和声音生成的有效性,为复杂声学场景中的整体视频配音建立了新的范例。 \footnote{该项目的演示页面是 https://holidubber.github.io}