论文
LENS:自适应时空缩放,用于长视频中的关键帧采样
LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos
摘要
尽管多模态 大语言模型 (MLLM) 取得了快速进展,但理解长格式视频仍然受到有限的上下文窗口的瓶颈。虽然最近的关键帧采样方法试图通过将视频输入提取为一组紧凑的查询相关帧来缓解这一问题,但在巨大的时空搜索空间中导航仍然具有挑战性,因为空间细节和时间覆盖范围经常发生冲突。为了解决这个问题,我们引入了 LENS,这是一个 无需训练 关键帧采样框架,它可以根据文本查询动态决定何时放大细粒度细节以及何时缩小以获得更广泛的上下文。具体来说,LENS 自适应地在空间放大和时间缩小之间分配有限的帧预算,空间放大突出显示各个帧内与查询相关的区域,而时间缩小则通过多帧聚合扩展时间范围,使模型能够跨多个粒度进行推理,同时捕获高保真细节和远程上下文。在各种长格式视频基准测试中,LENS 始终优于先前最先进的关键帧采样方法,并比均匀采样提供了显着的增益,利用 Qwen2.5-VL 将 Video-MME 准确率从 53.3% 提高到 60.7%。代码可在 https://github.com/zhangce01/LENS 上获取。