论文
在统一框架中桥接视频理解和生成
Bridging Video Understanding and Generation in a Unified Framework
摘要
最近,统一图像的生成和理解得到了广泛的探索。然而,将这种统一的建模范例扩展到视频领域仍然很大程度上尚未得到充分探索。一个核心挑战是视频理解倾向于紧凑的、有区别的语义表示,而视频生成需要密集的信号来保留视觉细节和时间连贯性。视频自然地捕捉空间语义和时间动态,使它们比静态图像更适合统一多模态建模。在本文中,我们提出了 Vega,一个连接视频理解和生成的统一框架。 Vega 利用共享词汇表对文本和视觉表示进行联合建模,并采用将自回归 (AR) 预测与基于扩散的渲染相结合的混合架构。具体来说,AR 模型专注于预测关键帧的语义上有意义的视觉标记,提供指导扩散模块渲染密集、高分辨率视频帧的结构化表示。大量实验表明,Vega 在 VBench 等视频生成基准测试和 VideoMME 等视频理解基准测试上取得了强大的性能。