论文
GroundVTS:用于视频时序定位的多模态 大语言模型 中的视觉词元采样
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
摘要
视频时间定位 (VTG) 是视频理解中的一项关键任务,也是将视频 大语言模型 (Vid-LLM) 扩展到更广泛应用的关键能力。然而,现有的 Vid-LLM 依靠均匀的帧采样来提取视频信息,导致关键帧分布稀疏并丢失关键的时间线索。为了解决这一限制,我们提出了基于视觉词元采样(GroundVTS),这是一种 Vid-LLM 架构,专注于信息最丰富的时间段。 GroundVTS 采用细粒度、查询引导的机制来过滤视觉标记,然后将其输入 LLM,从而保留基本的时空信息并保持时间一致性。此外,我们引入了一种渐进式优化策略,使 LLM 能够有效适应视觉特征的非均匀分布,增强其对时间依赖性进行建模并实现精确视频定位的能力。我们在三个标准 VTG 基准上对 GroundVTS 进行了全面评估,它的性能优于现有方法,在时刻检索的 mIoU 上实现了 7.7 点的改进,在高光检测的 mAP 上实现了 12.0 点的改进。代码可在 https://github.com/Florence365/GroundVTS 获取。