论文
用于物理上合理的视频生成的缓和自相似性对齐
Tempered Self-Similarity Alignment for Physically Plausible Video Generation
摘要
尽管视频生成模型取得了显着进步,但它们仍然难以生成物理逼真的视频,经常表现出外观漂移、难以置信的运动和时间不一致。在这项工作中,我们通过将以时空自相似性(STSS)编码的关系知识从视觉基础模型转移到视频生成模型来解决这一限制。 STSS 表示跨空间和时间的特征之间的成对相似性,揭示视频中对象如何与其他实体交互的关系结构,有效捕获现实世界的动态,包括对象运动和语义转换。为了转移这种关系知识,我们提出了调和自相似性对齐(TSA)损失,它将 STSS 转换为概率对应分布,并训练视频生成模型以将其对应分布与动态变化区域上的视觉基础模型的对应分布对齐。在 VideoPhy 和 VideoPhy2 基准上进行评估,我们的方法证明了跨不同交互场景的物理合理性的显着改进,验证了为物理真实视频生成传输关系知识的有效性。