论文
VideoChat3:完全开放的视频 MLLM,用于高效、通用的视频理解
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
摘要
视频理解领域的最新进展涵盖了运动、长视频和流交互,推动该领域走向现实世界的应用。尽管取得了这些进展,当前的开源模型在几个方面仍然受到限制。他们通常很难概括不同的视频类型,从而使其仅在特定领域有效。高计算需求进一步限制了它们的效率和可扩展性。此外,大多数模型只是部分开放,训练代码、策略或数据集等关键组件不可用,这阻碍了可重复性并减慢了社区驱动的开发。为了解决这些问题,我们推出了 VideoChat3,这是一个完全开放、高效且通用的以视频为中心的 MLLM。 VideoChat3 通过两种互补的设计提高视频理解能力。为了提高效率,我们引入了 Inflated 3D Vision Transformer (I3D-ViT) 和用于流视频感知的自适应帧分辨率,它可以实现高效的时空表示,并降低训练和推理期间处理视频输入的成本。为了提高效率,我们开发了一个可扩展的视频数据合成管道,可提供三个多样化的高质量训练数据集:VideoChat3-Academic2M、VideoChat3-LV116K 和 VideoChat3-OL617K,涵盖一般、长格式和流视频场景,提高模型跨领域的泛化能力。通过集成这些设计,VideoChat3 在广泛的泛化性和计算效率之间实现了罕见的平衡。跨通用、长格式和流媒体基准测试的实验表明,VideoChat3 超越了之前的开源模型,参数数量相同或更大,参数数量仅为 4B,效率更高。