论文

R^3:通过推理引导的回忆和重新排序进行组合视频检索

R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking

模型推理推理策略与问题分解

摘要

CoVR-R 挑战评估组合视频检索,其中系统必须在给定参考视频和文本编辑指令的情况下从大型图库中检索目标视频。此设置不是标准的视频文本检索问题:查询是由源视频中的视觉证据和编辑隐含的转换定义的。强大的嵌入模型可以提供可扩展的候选召回,但它可能无法表达目标端后果,例如状态更改、动作替换、对象保留或时间一致性。成对多模态重排序可以更明确地验证这些细节,但对整个图库进行详尽的重新排序在计算上是不可行的。我们提出了 $\mathbb{R}^3$,这是一个围绕推理引导的召回和重新排序构建的零样本视频检索管道。核心思想是将源编辑查询转变为基于推理的检索程序,而不是将编辑文本视为简短的描述文本。首先,模型生成推理轨迹,描述应用编辑后的预期目标视频。然后,轨迹与源视频一起编码为推理增强查询,并且其检索分数通过协议门控残差规则与基本组成的查询融合。最后,重新排序器通过直接源候选比较来验证召回的候选。实验证明了我们的方法在应对这一挑战方面的有效性。代码可在 https://github.com/Lee-zixu/R-3 上获取。