论文

Weave Forcing:交互式长视频生成的组合记忆路由

Weave Forcing: Compositional Memory Routing for Interactive Long Video Generation

模型推理解码与生成控制

摘要

自回归视频生成的近期进展改善了长时程时间一致性,但交互式叙事需要的不仅是连续场景延伸:新镜头可能组合来自不同历史镜头的角色与背景。全提示检索会忽视各组件不同的参考需求,直接组合所有历史记忆则可能引入无关视觉内容。为此我们提出Weave Forcing——交互式长视频生成中组合式记忆复用的训练自由框架:先用LLM做语义槽路由,把用户提示分解为角色与背景描述并为每个组件显式选择合适的历史参考;为隔离所需内容,掩码记忆编织使用以语义槽为条件的对比注意力图构建精化语义掩码,选择性地从压缩历史KV记忆中暴露相关token以引导当前镜头生成;进一步引入覆盖自适应RoPE,按无/部分/完整参考覆盖调整时间偏移与记忆保留,解决不完整历史参考被置于接近当前生成位置时观察到的视觉伪影。大量实验显示Weave Forcing改善跨镜头主体与背景一致性,同时保持有竞争力的视觉质量与文本对齐。