论文
RSVideo:您的视觉语言模型准备好用于遥感视频了吗?
RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?
摘要
遥感视频可以实时观察目标属性的变化、短期活动和场景演变。它们记录了孤立图像无法捕捉到的运动、动作、交互和场景变化。现有模型主要针对单个图像或跨越较长时间范围的离散时间观察。然而,仍然缺乏用于评估连续遥感视频理解的视觉语言模型的统一评估设置。我们引入了 RSVideo-10K,这是一个遥感视频数据集,包含 10,773 个实例、147 万帧和 17.02 小时的镜头,包含无人机和卫星平台。其固定评估基准 RSVideo-Bench 包含 2,731 个测试实例,评估遥感视频理解的两个互补方面:L1 感知和 L2 推理,涵盖 7 个能力组和 17 个任务。评估表明,当前的视觉语言模型仍然难以恢复小的局部证据、跟踪短暂的状态以及使用场景约束的空间关系。基于此分析,我们进一步提出 RSVideo,一种用于小目标时空聚焦的强化学习框架,可跨帧选择与问题相关的区域并抑制冗余背景标记。 RSVideo 在 InternVL3.5-14B 上实现了 9.01% 的最大绝对改进,在 Qwen3.6-27B 上在 26 个开源视觉语言主干上实现了 40.63% 的最高精度。代码可在 https://github.com/HongjieZhou0329/RSVideo 获取。