论文
推理、检索、重新排序:用于组合视频检索的零样本推理感知框架
Reason, Retrieve, Re-rank: A Zero-Shot Reasoning-Aware Framework for Composed Video Retrieval
摘要
组合视频检索 (CoVR) 寻找对参考视频应用自由格式文本修改而产生的目标视频。我们在 CVPR~2026 VidLLMs 研讨会上解决了 \emph{Reason-Aware} CoVR (CoVR-R) 挑战,其中检索严格是零样本。我们提出 \textbf{R3-CoVR} (\emph{Reason, Retrieve, Re-rank}),一个完全由冻结的基础模型构建的 无需训练 管道。多模态 大语言模型 (Qwen3-VL-8B) 对编辑所暗示的 \emph{后效} 进行推理——状态转换、动作阶段、场景、摄像机和节奏——并用语言表达简洁的编辑后描述;对比视频文本编码器(SigLIP-2)嵌入此描述和图库以进行第一阶段检索;最后,约束感知重新排名阶段使用相同的多模式模型作为法官,根据预期的编辑结果对每个入围候选人进行评分。在挑战测试集上,R3-CoVR 达到 \textbf{91.9\% R@1} 和 \textbf{98.2\% R@10}。有两个发现推动了这些结果:(i)~将描述长度与对比编码器的文本窗口相匹配将 \Rk{1} 从 $67.5$ 提升到 $72.7$; (ii)~约束感知重排序器仅对入围名单进行重新排序,将 \Rk{1} 从 $72.7$ 提升到 $91.9$——单一最大收益。我们分析了重新排序器的行为、检索/重新排序混合以及候选名单深度,并发布了一个干净的三层实现。