论文
扎根强迫:在自回归视频合成中桥接时间无关语义和近端动力学
Grounded Forcing: Bridging Time-Independent Semantics and Proximal Dynamics in Autoregressive Video Synthesis
摘要
自回归视频合成为无限视野生成提供了一条有前途的途径,但从根本上受到三个相互交织的挑战的阻碍:上下文限制导致的语义遗忘、位置外推导致的视觉漂移以及交互式指令切换期间的可控性损失。当前的方法通常孤立地解决这些问题,限制了长期的一致性。我们引入了 Grounded Forcing,这是一种新颖的框架,它通过三个联锁机制将时间无关的语义和近端动力学联系起来。首先,为了解决语义遗忘问题,我们提出了一种双内存 KV 缓存,它将局部时间动态与全局语义锚点解耦,确保长期语义一致性和身份稳定性。其次,为了抑制视觉漂移,我们设计了双参考 RoPE 注入,它将位置嵌入限制在训练流形内,同时呈现全局语义时不变。第三,为了解决可控性问题,我们开发了非对称邻近重新缓存,它通过邻近加权缓存更新促进提示转换期间的平滑语义继承。这些组件协同运作,将生成过程束缚在稳定的语义核心上,同时适应灵活的局部动态。大量实验表明,Grounded Forcing 显着增强了远程一致性和视觉稳定性,为交互式长格式视频合成奠定了坚实的基础。