论文

时空语义重要性引导的 AI 视频联合压缩与编辑

A Spatiotemporal Semantic Importance-Guided Unified Compression and Editing Framework for AI-Generated Videos

模型推理解码与生成控制

摘要

人工智能生成的视频在数量、持续时间和分辨率方面迅速增加,对高效存储和传输的需求不断增长。与从物理世界捕获的自然视频不同,人工智能生成的视频是来自学习生成分布的样本,其中语义结构对于内容一致性至关重要,而许多局部纹理和随机细节可以合理地重新生成。这种区别表明压缩应该保留语义上重要的时空信息,而不是重建特定生成样本的每个像素。除了重建之外,人工智能生成的视频还产生了基于提示的编辑的实际需求,用户希望修改生成的内容,同时保留其原始时空语义。受这些观察的启发,我们提出了一个用于人工智能生成视频的统一压缩和编辑框架,其中包含冻结视频生成器作为可重用的生成先验。在此框架内,我们设计了三种时空语义重要性引导技术,分别解决传输什么、传输多少以及如何使用传输的辅助信息。首先,创新选择方法使用时空语义重要性来预测潜在差异,以便所选择的创新优先考虑语义不变量而不是可替换的生成变化。其次,帧自适应比特分配方法估计潜在帧的非均匀语义需求,并将更多创​​新分配给需要更强语义保留的帧。第三,统一的重建和编辑方法不断调整传输的辅助信息的影响,使相同的压缩表示能够为忠实重建提供强有力的指导,或者作为保留结构的提示驱动编辑的灵活语义锚。

时空语义重要性引导的 AI 视频联合压缩与编辑的原论文方法或结果图
图 1:所提出的用于人工智能生成视频的时空语义重要性引导统一压缩和编辑框架的概述。