论文
Vortex:用于智能视频检索的多模态融合系统
Vortex: Multi-Modal Fusion System for Intelligent Video Retrieval
摘要
本文介绍了 Vortex,这是我们的团队 FocusOnFun 为 2025 年胡志明市人工智能挑战赛开发的多模态视频检索系统,旨在推进智能多媒体搜索和时间推理。该系统集成了自适应关键帧提取、从视觉语言和语音模型生成多模态元数据,以及通过倒数排序融合融合 CLIP 和 SigLIP2 嵌入以平衡全局和细粒度语义的混合检索策略。为了增强交互性,Vortex 结合了基于 Rocchio 的相关反馈和用于顺序事件对齐的多阶段时间搜索机制。该架构基于 Milvus 和 Elasticsearch 构建,可实现可扩展的索引和高效的检索。在正式比赛评估中,我们FocusOnFun团队的系统在初赛中获得了79.6/88(90.5%)的成绩,并在决赛中进一步评估,取得了“优秀”的整体表现,在问答(QA)任务中取得了“杰出”的成绩。这证明了 CLIP 和 SigLIP2 的互补优势,并证实了混合检索方法的有效性。该系统为未来智能、上下文感知和交互式视频检索的研究奠定了坚实的基础。