论文

束缚主体,释放场景:用于长视野自回归视频生成的查询感知内存路由

Tether the Subject, Release the Scene: Query-Aware Memory Routing for Long-Horizon Autoregressive Video Generation

摘要

流式自回归视频模型逐块生成长视频,使用历史内存来保持一致性。现有方法通常通过类似的策略向历史公开主题和场景查询。这可以稳定主体,但即使局部运动继续,也可以将背景、视点和场景结构锁定到先前生成的状态。我们将这种失败的记忆锚定场景称为进展不足;仅凭一致性和运动指标就可能会错过它。我们推出了 TetherMem,这是一种用于冻结视频生成器的 无需训练 查询感知时空内存路由器。 TetherMem 将主题和场景查询分开,并通过区域和年龄条件先验来调节历史访问:主题查询保留身份承载历史,而场景查询减少对主题历史和陈旧背景的依赖。在来自 10 位注释者的 2,400 个盲法成对判断中,TetherMem 在整体质量 (0.780) 和场景进展 (0.769) 的八个流媒体长视频基线中实现了最高的估计预期偏好。在完整的 30 秒视频中,它可以维持背景、视点和场景状态的变化,同时保留主题的可识别性和时间连续性。