论文
Prompting-MammAlps:相机陷阱数据的细粒度文本到视频检索
Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data
摘要
从大型相机陷阱数据集中自动检索视频仍然具有挑战性。基于大型视频语言模型 (VLM) 的文本到视频检索 (TVR) 方法有可能通过使用简单的文本查询描述感兴趣的事件来检索它们。然而,当前的方法往往缺乏时空理解,并且不能很好地推广到生态数据。在这项工作中,我们介绍了第一个相机陷阱 TVR 基准 Prompting-MammAlps,并提出了一种细粒度且可解释的 TVR 方法。具体来说,我们训练了一个视觉 Transformer 来执行时空动作定位,并将其输出转换为结构化文本,描述每个视频。独立地,受行为学启发的查询由基于 编码智能体 的大语言模型 (LLM) 进行处理,以解析每个视频的结构化文本并相应地检索视频。我们利用 LLM 来使用自定义解析库中的函数,以最大限度地降低 LLM 幻觉的风险并提高方法的可解释性。这种应用于 Prompting-MammAlps 基准的检索方法在 135 个生态相关查询和 775 个候选视频的测试集上实现了 34% 的基于集的 F1 分数。相比之下,最好的零样本 VLM 达到了 18% 的 F1 分数,同时也缺乏可解释性。项目页面:https://cnai.epfl.ch/prompting-mammalps