论文
ForeSea:用于视频监控的具有多模式查询的人工智能取证搜索
ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance
摘要
尽管经过了数十年的努力,监控仍然难以在长长的多摄像机视频中搜索和推理特定目标。现有的方法 - 跟踪、检索和视频 LLM 需要大量的手动过滤,仅捕获浅层属性,并且无法理解时间。先前的基准也仅限于基本检索和问答,而没有解决通常涉及多模式查询和时间基础的现实世界挑战(例如,“这个人什么时候加入战斗?”与该人的图像)。为了解决这一差距,我们引入了 ForeSeaQA,这是一个专门为视频 QA 设计的新基准,具有图像和文本查询以及关键事件的时间戳注释。该数据集由长视距监控录像和各种多模态问题组成,能够在现实法医条件下对检索、时间基础和多模态推理进行系统评估。不仅限于这个基准,我们还提出了 ForeSea,这是一个具有 3 阶段、即插即用管道的人工智能取证搜索系统。 (1)跟踪模块过滤不相关的镜头; (2)多模态嵌入模块对剩余剪辑进行索引; (3) 在推理过程中,系统检索视频 LLM 的前 K 个候选剪辑,以回答查询并定位事件。在 ForeSeaQA 基准上,与之前的检索增强基线相比,ForeSea 的准确性提高了 3.1 点,时间 IoU 提高了 10.1 点。据我们所知,ForeSeaQA 是第一个支持具有精确时间基础的复杂多模式查询的基准测试,而 ForeSea 是第一个在此设置中表现出色的 VideoRAG 系统。