论文
在低资源视频任务适应中,我们在哪里(不需要)需要时间上下文?
Where Do We (Not) Need Temporal Context in Low-Resource Video Task Adaptation?
摘要
参数高效的 微调 (PEFT) 和探测可以仅使用少量可训练参数来适应基础模型,这对于注释和计算昂贵的视频理解很有吸引力。然而,视频 PEFT 专注于适应图像预训练模型,而标准 PEFT 方法也可以应用于视频表示。这些设置很少进行比较,并且都将时间推理限制在模型的单个组件中,从而使时间上下文如何在主干网、PEFT 和探针之间分布保持开放。在这项工作中,我们对视频理解的模型适应策略进行了系统研究。我们评估了以外观为中心、以运动为中心和空间密集设置的方法,特别关注数据有限且参数效率最有利的场景。我们的结果为 PEFT 和跨设置探测提供了新的见解,并证明了时间上下文分配对于有效视频适应的重要性