论文

SALI:使用电影语法知识在文本到视频检索中进行跨镜头关系匹配的镜头感知后期交互

SALI: Shot-Aware Late Interaction for Cross-Shot Relation Matching in Text-to-Video Retrieval using Film-Grammar Knowledge

摘要

文本到视频检索通常通过单个嵌入来表示视频剪辑。这种嵌入往往会失去人与人之间的重要关系。例如,“安娜面对马克”的互动通常被拍摄为两者的交替镜头和反向镜头(图 1a)。单个镜头或剪辑镜头上的平均嵌入都无法捕捉到这种关系。因此,我们提出了 SALI(射击感知后期交互)。它从单句查询中提取主语和宾语,并将查询、其主语和宾语文本嵌入与视频剪辑的每个视觉镜头嵌入进行匹配。匹配算子是贪婪最大或最优传输。微调中的电影语法惩罚增加了一个小的、一致的转变。 SALI 基于 CLIP4Clip-meanP 构建,在 Condensed Movies 和 ActivityNet 上保持整体召回率不变,同时将多镜头关系查询的 R@1 提高了 3 点和 12 点,这是所有比较方法中最高的,并且以 1.4 R@1 的总体成本改进了 MSR-VTT 上的此类查询。