论文

压缩以记住:通过策略蒸馏学习紧凑内存以生成长视频

Compress to Remember: Learning Compact Memory via On-Policy Distillation for Long Video Generation

上下文与知识上下文工程

摘要

标准视频生成器本身并不将历史上下文压缩为可重用的内存词元。随着生成的继续,不断增长的历史使得由于长上下文退化而越来越难以保留早期帧中的信息。基于关键帧的方法通过保留选定的过去帧来解决这一挑战,但可能会丢弃下一代所需的信息。我们不只依赖于帧选择,而是研究冻结视频生成器是否可以提供学习历史的紧凑表示所需的监督。我们提出预测对齐上下文压缩(PACC),它使用学习的压缩器将过去帧中的信息聚合到紧凑的内存标记中。我们通过策略蒸馏来训练压缩器,使用相同的冻结生成器,作为学生时以压缩内存为条件,作为教师时以完整历史为条件。学生生成延续,而教师在每个去噪步骤中为相同的噪声输入提供目标。仅更新压缩器以使学生的预测与这些目标保持一致。我们在 MBench 上评估 PACC,它联合测量内存事件覆盖率和一致性。 PACC 在 Causal-rCM 上比最强基线高出 6.63 点,在 Causal Forcing 上比最强基线高出 3.19 点。使用 MovieGen 提示对 VBench-Long 进行的评估进一步表明,PACC 可以生成一分钟长的视频,其生成质量可与基线相媲美。总之,这些结果表明,学习压缩历史上下文可以在不修改底层生成器的情况下提高长视频记忆。