论文

视频生成中的时间状态传输:诊断和纠正频谱不平衡

Temporal State Transport in Video Generation: Diagnosing and Correcting Spectral Imbalance

模型推理解码与生成控制

摘要

可靠的视频生成需要的不仅仅是高质量的帧来形成连贯的故事:模型必须保持持久状态,跨时间传输身份、场景布局、运动和精细细节等视觉属性。现有的 无需训练 方法主要是加强跨框架注意力或分析局部注意力熵,但这些观点并没有揭示时间交互是否保持在健康的传输机制中。在这项工作中,我们从时间状态传输的角度研究视频生成。我们引入了光谱张力,这是一种将局部注意力扩散与全局光谱多样性进行比较的签名诊断,并用它来识别两种相反的时间故障:碎片传输和过度混合热点。基于这一诊断,我们提出了光谱传输稳态,这是一种 无需训练 调节器,可以温和地纠正病理性时间状态,同时在很大程度上保持平衡状态。对预训练视频生成模型的实验表明,原始模型通常占据不平衡的时间状态,而我们的方法有选择地对最差的时间热点应用更大的校正,并在不进行微调的情况下提高时间一致性和视觉质量。代码:https://github.com/lytang63/temporal-state-transport