论文
MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解
MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning
摘要
在高质量图像文本对的不断增加的推动下,最近的视觉语言模型(VLM)在视觉理解方面取得了显着的成功。然而,由于对时间理解的基本需求以及大规模带注释的视频数据的稀缺,VLM 在视频领域的性能通常会下降。在这项工作中,我们专注于海洋视频理解,这带来了进一步的挑战:首先,它需要大量的领域专业知识;视频 VLM 通常难以定位和解释海洋视频中的关键信息,因为信息事件通常稀疏、不可预测且分布不均匀。为了应对这些挑战,我们精心策划了第一个以事件为中心的海洋视频理解数据集,名为 MarineEVT,该数据集具有 20K 个多任务、视频级视觉问答对,涵盖海洋理解和分析的多个维度。同时,基于MarineEVT,我们将海洋视频理解分解为以事件为中心的视觉工具集成推理过程,简称EVT-R1,利用强大的视觉工具驱动模型定位和解释与视觉问题和人类意图一致的关键信息。为了证明其有效性,我们在不同设置下将 EVT-R1 与 11 个 SOTA VLM 进行比较。 EVT-R1 的性能分别比顶级开源模型和顶级商业模型高出 5.22 和 11.09。 MarineEVT 和 EVT-R1 为生态发现和海洋教育奠定了基础,促进了能够解释海洋动力学、推理生态相互作用并支持可持续海洋视频理解和分析的 VLM 的开发。