论文

释放视频中Grounding DINO 的潜力:有限数据时空定位的参数高效适应

Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization

模型训练参数高效训练

摘要

时空视频目标定位(STVG)旨在定位动态视频片段中的查询对象。众所周知,经过充分训练的方法需要大量数据。然而,收集大规模 STVG 数据非常具有挑战性:密集的帧级边界框和复杂的时间语言对齐的注释成本极高,特别是对于专门的视频领域。因此,传统模型在这些固有的有限数据集上严重过度拟合,而零样本基础模型缺乏精确定位所需的特定于任务的时间感知。为了解决这一小数据挑战,我们引入了 ST-GD,这是一种数据高效的框架,可将预先训练的 2D 视觉语言模型(例如,Grounding DINO)应用于视频任务。为了避免破坏小数据集上预先训练的先验知识,ST-GD 保持基本模型冻结,并策略性地注入轻量级适配器(约 10M 可训练参数)以灌输时空意识,以及用于边界预测的新型时间解码器。这种设计自然可以应对数据稀缺的问题。因此,ST-GD 在数据稀缺场景中表现出色,在有限规模的 HC-STVG v1/v2 基准上实现了极具竞争力的性能,同时在 VidSTG 数据集上保持了强大的泛化能力。这验证了 ST-GD 作为严格小数据约束下复杂视频理解的强大范例。