论文

Salt++:用于少步流多模态生成的上下文对齐后训练

Salt++: Context-Aligned Post-Training for Few-Step Streaming Multimodal Generation

摘要

少步流式音频视频生成需要因果建模和步骤蒸馏,但标准训练方法面临两个与上下文相关的挑战。教师强制将干净的历史与嘈杂的目标配对,但仅通过速度预测间接监督预测上下文表示。同时,在因果分布匹配蒸馏 (DMD) 中直接重用双向评分模型会造成生成上下文和评分上下文之间的不匹配。我们使用 Salt++ 来应对这些挑战,Salt++ 是一个两阶段的训练后框架,由因果自流 (CSF) 和上下文对齐的自回归 DMD 组成。 CSF 通过改变历史同时保持噪声目标固定来利用上下文信息不对称:噪声混合历史学生将其中间表示与干净历史指数移动平均教师的中间表示对齐。这种自我监督信号鼓励学生提取语义信息并改善跨模式对齐。上下文对齐的 AR DMD 在生成器采样、假分数训练和真实分数评估之间共享因果掩码和前缀,以匹配块条件 KL 目标下的生成分布和参考分布。在经过校准的教师指导下,它执行干净前缀的几步蒸馏,然后适应生成的历史,而无需切换目标或需要单独的一致性蒸馏。在 480p 下,在相同的 4 步因果设置下,Salt++ 在 JavisBench 上的视觉和运动质量比 OmniForcing 提高了 57% 和 45%。一个单独的规模化后训练阶段将 Salt++ 扩展到 4 步 $1664\times960$ 生成,在七个报告指标中的六个指标上优于双向 LTX-2。项目页面:https://xingtongge.github.io/Saltpp