论文

SMC-ITA:用于视频到音频生成的顺序蒙特卡罗推理时间对齐

SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation

模型推理推理搜索与路径规划

摘要

视频到音频(V2A)的生成必须共同满足视听对齐、语义一致性、时间同步和感知质量。虽然之前的工作主要集中在模型架构、多模态调节和训练目标上,但 V2A 的推理时间对齐仍未得到充分探索。在本文中,我们研究了基于流匹配的 V2A 生成的推理时间对齐,并将其表述为搜索问题。我们提出了顺序蒙特卡罗推理时间对齐(SMC-ITA),它结合了基于前瞻的奖励估计和顺序蒙特卡罗重采样,以使用多维跨模式奖励自适应地重新分配计算。 SMC-ITA 比简单的单轨迹采样有所改进,DeSync 相对减少了 55.67%,IB 分数提高了 20.23%,音频质量提高了 15.44%。在匹配的 NFE 预算下,它还在比较的搜索基线之间实现了最佳的整体权衡,优于 Best-of-N 和 Beam Search。消融研究进一步表明,前瞻提高了中间奖励估计的可靠性,并且系统重采样是 V2A 推理时间对齐的强大实际默认值。