论文

CoVisco:具有本机词元压缩的编解码器本机视觉编码器,用于统一图像视频理解

CoVisco: Codec-Native Vision Encoder with Native Token Compression for Unified Image-Video Understanding

模型架构Transformer

摘要

视觉语言模型面临着一个基本的扩展瓶颈:视觉词元的数量随着时间持续时间和空间分辨率的增加而增长,使得长视频理解对于视觉编码器和语言模型来说成本高昂。现有方法通常在密集编码后压缩视觉词元,从而导致训练期间使用的表示与部署时所需的紧凑接口之间不匹配。我们推出了 CoVisco,一种编解码器本机视觉编码器,具有本机词元压缩功能,可实现统一的图像视频理解。通过将编解码器本机输入支持与分段注意力相结合,CoVisco 可以在单个前向传递中对长视觉输入进行编码,而无需在所有帧之间形成密集的补丁间交互。每个时间段都配备了可学习的抽象标记,可以学习紧凑的段级表示,而细粒度的补丁标记在整个编码器中仍然可用。交替的段内层和抽象通信层通过抽象词元通道保留视频级上下文。轻量级选择器进一步公开单独的抽象词元或使用运行时选择的补丁词元子集增强的抽象词元,从而产生紧凑的视觉界面,减少下游 MLLM 的视觉上下文和预填充负担,同时在需要时保留细粒度的证据。 CoVisco 在 5.65 亿图像-文本对和 640 万视频上使用对比目标进行了预训练,在面向视频的嵌入和多模态理解基准上显示出具有竞争力的性能。在评估的四段、64 帧设置中,仅抽象推理仅使用 400 个视觉词元,同时实现的视频理解性能接近甚至在某些基准上超过 OneVision-Encoder。选定的补丁标记进一步提高了细粒度视频推理。项目网址:https://github.com/ernie-research/CoVisco.git