论文
相互强迫:用于快速自回归音频-视频字符生成的双模式自进化
Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
摘要
在这项工作中,我们提出了 Mutual Forcing,一种具有长视野音视频同步的快速自回归音视频生成框架。我们的方法解决了两个关键挑战:联合音频视频建模和快速自回归生成。为了简化联合音视频优化,我们采用两阶段训练策略:首先训练单模态生成器,然后将它们耦合到统一的音视频模型中,以便对配对数据进行联合训练。对于流生成,我们询问是否可以直接训练原生快速因果音视频模型,而不是遵循现有的流 蒸馏 管道,这些管道通常首先训练双向模型,然后通过多个 蒸馏 阶段将其转换为因果生成器。我们的答案是相互强迫,它直接构建在本机自回归模型上,并将少步和多步生成集成在单个权重共享模型中,从而实现自我 蒸馏 并提高训练推理一致性。多步模式通过自我蒸馏改进了少步模式,而少步模式在训练过程中生成历史上下文,以提高训练-推理的一致性;由于这两种模式共享参数,因此这两种效应在单个模型中相互增强。与 Self-Forcing 等现有方法相比,Mutual Forcing 不需要额外的双向教师模型,支持更灵活的训练序列长度,减少训练开销,并允许模型直接从真实的配对数据而不是固定的教师中进行改进。实验表明,相互强迫匹配或超过了需要大约 50 个采样步骤的强基线,而仅使用 4 到 8 个步骤,在效率和质量方面展现了巨大的优势。该项目页面位于 https://mutualforcing.github.io。