论文
视觉瓶颈:用于联合视频时空定位的 MLLM 稀疏帧自适应
The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding
摘要
大型视频平台每小时处理数百万次上传,需要审核系统能够定位每个视频中发生政策违规的时间和地点。大规模处理每一帧是不可行的,因此系统仅限于每个视频 8 到 16 帧的稀疏输入。然而,最先进的多模态 大语言模型 (MLLM) 是在数百帧的密集序列上进行预训练的,导致训练和部署条件之间存在根本性的不匹配。这种不匹配导致严重的性能崩溃:当帧减少到 16 时,Qwen3-VL 8B 模型的时间 mIoU 从 56.0% 下降到 22.3%,相对退化为 60.2%。我们对训练策略进行了系统的实证研究,以缩小时空视频基础的差距。我们的结果表明,视觉特征提取是稀疏帧输入下的主要瓶颈。仅调整最后三个 ViT 层(占总参数的 4%)即可实现 68.8% 的时间 mIoU,并超过使用密集输入的零样本 8B 模型 12.8 个点。相比之下,语言模型 微调 提供的回报可以忽略不计或为负。当时间边界可用时,边界感知采样策略 Hybrid16 比均匀采样进一步将时间 mIoU 提高了 26 个点。我们得出的结论是,对于稀疏帧视频基础,训练策略主导模型规模:微调的 2B 模型始终优于零镜头 8B 模型,无论有或没有密集帧访问。