论文
MAVIS:通过结构化视频理解进行多智能体视频检索
MAVIS: Multi-Agent Video Retrieval via Structured Video Understanding
摘要
视频检索的主导范式依赖于基于嵌入的全语料库扫描,这种模式存在固有的计算效率低下以及信息密集视频和稀疏文本查询之间语义不对称的问题。为了弥补这一差距,我们引入了 \textbf{MAVIS},这是一种新颖的多智能体框架,它将检索重新视为合作推理而不是暴力搜索。 MAVIS 首先通过将原始视频解析为 \textbf{结构化语义库} 来弥补粒度不匹配,从而实现显式属性级索引。在检索过程中,规划器将复杂的用户意图分解为原子子任务,派遣专门的代理来独立提名候选人。至关重要的是,MAVIS 采用了具有严格否决协议的 \textbf{逻辑感知辩论} 机制,其中代理协作修剪逻辑不匹配,以识别一组紧凑的“有争议”候选者,以进行细粒度验证。这种代理工作流程有效地绕过了全库遍历的低效问题。 MSR-VTT、MSVD 和 ActivityNet 上的大量实验表明,MAVIS 无需特定于任务的 微调 即可实现具有竞争力的性能,为传统双编码器方法提供了可扩展且可解释的替代方案。