论文
CoSyncDiT:用于电影配音的认知同步扩散 Transformer
CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing
摘要
电影配音的目的是合成语音,保留参考音频的声音特征,同时与目标视频中的嘴唇运动同步。由于持续时间级别的显式对齐,现有方法无法实现精确的口型同步并且缺乏自然度。虽然隐式对齐解决方案已经出现,但它们仍然容易受到参考音频的干扰,从而在野外场景中引发音色和发音退化。在本文中,受专业演员认知过程的启发,我们提出了一种由认知同步扩散 Transformer(CoSync-DiT)驱动的新颖的基于流匹配的电影配音框架。该架构通过执行声学风格适应、细粒度视觉校准和时间感知上下文对齐,逐步引导噪声到语音的生成轨迹。此外,我们设计了联合语义和对齐正则化(JSAR)机制,以同时约束上下文输出上的帧级时间一致性和流隐藏状态上的语义一致性,从而确保鲁棒对齐。对标准基准和具有挑战性的野外配音基准的广泛实验表明,我们的方法在多个指标上实现了最先进的性能。