论文

使用结构化编辑提示和密集稀疏融合对 CoVR-R 进行推理然后检索

Reason-Then-Retrieve for CoVR-R with Structured Edit Prompts and Dense-Sparse Fusion

模型推理推理策略与问题分解

摘要

CoVR-R 研究理性感知组合视频检索:给定参考视频和编辑指令,系统必须检索满足编辑要求的目标视频。主要困难是没有直接描述目标;它必须从对象身份、动作顺序、最终状态、手部交互和场景转换的细粒度变化中推断出来。我们围绕 Qwen3.5-27B 构建了一个零样本推理然后检索管道。对于每个图库视频,该模型通过将生成的词元隐藏状态与词元相关的权重进行池化,生成面向检索的结构化描述和密集嵌入。对于每个查询,模型首先对参考视频和指令执行编辑推理,然后生成目标视频描述,其隐藏状态用作查询嵌入。我们在生成的文本上使用 TF-IDF 分支补充密集检索,并将两个排名与特定于分割的权重融合。经验证,当前最佳提交在 R@1 处达到 80.81,在 R@5 处达到 94.86,在 R@10 处达到 97.11,在 R@50 处达到 98.59。在盲测试中,R@1 时达到 89.73,R@5 时达到 95.79,R@10 时达到 96.63,R@50 时达到 97.98。