论文

InstrAct:在教学视频中实现以行动为中心的理解

InstrAct: Towards Action-Centric Understanding in Instructional Videos

模型训练预训练

摘要

理解教学视频需要识别细粒度的动作并对其时间关系进行建模,这对于当前的视频基础模型(VFM)仍然具有挑战性。这种困难源于嘈杂的网络监督和普遍的“静态偏差”,其中模型依赖于对象而不是运动线索。为了解决这个问题,我们提出了 InstrAction,一个用于教学视频以动作为中心的表示的预训练框架。我们首先引入一种数据驱动策略,该策略过滤有噪声的视频描述并生成以动作为中心的困难负样本,以在对比学习期间将动作与对象分开。在视觉特征级别,动作感知器从冗余视频编码中提取与运动相关的标记。除了对比学习之外,我们还引入了两个辅助目标:用于建模顺序时间结构的动态时间扭曲对齐(DTW-Align)和用于加强跨模态基础的掩蔽动作建模(MAM)。最后,我们引入 InstrAct Bench 来评估以动作为中心的理解,我们的方法在语义推理、程序逻辑和细粒度检索任务方面始终优于最先进的 VFM。