LLaVA-OneVision-2:迈向下一代感知智能
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
摘要
我们推出了 LLaVA-OneVision-2 (LLaVA-OV-2),这是迄今为止 LLaVA-OneVision 系列中功能最强大的视觉语言模型,在广泛的多模式基准测试中实现了卓越的性能。该模型建立在原生 OneVision 编码器的基础上,并结合了窗口注意力机制,以实现高效的本地计算,同时保持原生分辨率。它的关键进步是编解码器流标记化:它将压缩视频视为连续的比特成本流,其中比特成本动态确定自适应时间组,运动残留线索将显着的空间证据选择到紧凑的视觉画布中。这种分配将有限的 词元预算 集中在承载事件的内容上,从而实现比固定图片组更稳定的长视频词元压缩。共享的 3D RoPE 进一步将编解码器画布、采样帧和图像放置在统一的时空坐标系中。此外,我们围绕大规模开放监督构建了 LLaVA-OV-2 数据和训练堆栈:用于预训练的大约 8M 重新字幕视频样本、微调 的 4M 样本空间语料库。我们还引入了 JumpScore,这是一种时间定位基准,针对高频、密集重复运动的细粒度基础,这是现有视频评估中未充分体现的一种机制。 LLaVA-OV-2 的一个突出功能是它在视频理解、时间基础、空间基础和操作轨迹推理方面的统一感知。在 JumpScore 上,LLaVA-OneVision-2-8B 达到 74.9 JumpScore mAP,超过 Qwen3-VL-8B (30.1) +44.8 分;在同一基准上匹配的视觉 词元预算 下,编解码器流输入将帧采样的时间基础提高了 +9.7 个点。在标准基准测试中,LLaVA-OneVision-2-8B 在视频任务上比 Qwen3-VL-8B 进一步优于 Qwen3-VL-8B,平均分超过 4.3 分,在空间任务上比 Qwen3-VL-8B 平均分高出 5.3 分,在跟踪任务上比 Qwen3-VL-8B 平均分高出 15.6 分。