论文
超越相似性:基础模型作为 无需训练 组合视频检索的高效骨干
Beyond Similarity: Foundation Models as an Efficient Backbone for Training-Free Composed Video Retrieval
摘要
组合视频检索 (CoVR) 在图库中搜索目标视频,实现对源剪辑的自然语言修改。然而,在画廊规模上,这造成了根本性的紧张:紧凑的嵌入可以实现高效、可重用的搜索,但可能会错过瞬态动作、状态变化和需要细粒度视频推理的微妙约束,而应用大型多模态模型则统一牺牲可扩展性。为了解决这些限制,我们建议冻结基础模型应该扮演补充角色,推理深度适应查询难度。基于这个前提,我们引入了 无需训练 \methodexpansion{} 的框架 \methodname{}。具体来说,组合查询嵌入首先搜索可重用的纯视频图库表示;不确定的查询进行有界重排序和候选扩展;不明确的编辑会触发目标描述生成;并且只有接近领先的候选者才能达到多模式验证。为了支持这些角色,帧选择、空间分辨率和时间提示都适应每个阶段。在完整的目标库评估中,我们的方法在 无需训练 方法中达到了最先进的性能,在 Dense-WebVid-CoVR 和 CoVR-R 上分别具有 89.55 和 93.43 R@1(与最接近的对应物的绝对裕度超过 +35% 和 +25%)。这些结果表明,自适应编排基础模型功能可以将可扩展检索与细粒度推理结合起来,而无需特定于任务的训练。源代码和所有相关指南可在 https://github.com/demidovd98/CoVRAGE 上获取。