论文

范式转变:视频中时间句子基础的完全端到端训练

A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos

模型训练参数高效训练

摘要

视频中的时间句子基础 (TSGV) 旨在定位在语义上对应于未修剪视频中的句子查询的时间片段。当前大多数方法采用预训练的与查询无关的视觉编码器进行离线特征提取,并且视频主干被冻结并且未针对 TSGV 进行优化。这会导致为视觉分类训练但用于 TSGV 的视频主干出现任务差异问题。为了弥补这一差距,我们提出了一种完全端到端的范例,可以联合优化视频主干和本地化头。我们首先进行了一项实证研究,验证不同模型规模的冻结基线上的端到端学习的有效性。此外,我们引入了句子条件适配器(SCADA),它利用句子特征自适应地训练一小部分视频主干参数。 SCADA 有助于部署更深层的网络主干,减少内存,并通过语言嵌入的精确集成来调制特征图,从而显着增强视觉表示。两个基准测试的实验表明,我们的方法优于最先进的方法。代码和模型将被发布。