论文
Gen4U:通过扩散统一视频生成和理解
Gen4U: Unifying Video Generation and Understanding via Diffusion
摘要
先前的工作表明,扩散表示捕获底层几何,但难以处理高级语义。我们证明最先进的视频传播模型克服了这一限制。通过使用最近的相互 kNN 对齐指标系统地探测它们的中间激活,我们揭示了一个高度结构化的潜在空间,其中视觉表示在网络深度和噪声水平上演变。我们表明,虽然中等噪声水平产生线性可分离的全局语义,但细粒度细节在较低噪声水平下仍然存在,但在空间上分散,需要注意机制来解码。基于这些见解,我们引入了 Gen4U(理解生成),这是一个通过单次前向传递重新调整这些生成表示的用途的框架。我们的实验表明,冻结的大规模视频扩散模型可以作为具有高度竞争力的视频编码器,涵盖广泛的任务,涵盖语义和非语义目标(视频分类、深度估计、相机姿态估计、图像和视频字幕)。 Gen4U绕过微调,统一了生成和理解范式,实现了强大的感知性能,同时充分保留了模型生成高质量视频的能力。