论文
用于文本到视频生成的 MLLM 引导语义校正
MLLM-Guided Semantic Correction for Text-to-Video Generation
摘要
扩散模型和 Transformer 架构的最新进展导致文本到视频生成领域取得了重大进展。然而,这些模型经常会出现语义错误,例如丢失对象、不正确的属性或不匹配的操作。尽管一些语义校正方法在采样前进行优化或采样后进行细化,但如何在视频生成过程中检测和校正语义偏差仍然没有得到充分探索。在本文中,我们介绍了一种可解释的中代校正框架 无需训练,它将多模态 大语言模型 (MLLM) 反馈直接集成到扩散采样环路中。我们的框架通过在视频合成过程中注入语义评估信号来实现扩散轨迹校正,使模型能够通过不断的自我反思来优化生成的内容。我们提出了两个关键模块:语义评估主管,用于生成用于语义评估和偏差诊断的中间预览帧;语义修改助手,通过可控的潜在轨迹干预来纠正推理过程中的语义漂移。我们的方法在不修改模型参数的情况下提高了语义对齐、视觉保真度和时间一致性。我们通过跨多个基准的广泛实验来验证我们方法的有效性。