论文

P-JEPA:通过联合嵌入预测架构进行程序视频表示学习

P-JEPA: Procedural Video Representation Learning via Joint Embedding Predictive Architecture

模型训练预训练

摘要

嵌入式人工智能平台的日益成熟促使人们对程序视频表示学习越来越感兴趣,以支持智能辅助系统执行复杂的多步骤任务。利用大规模潜在预测训练,视频基础模型捕获视频动态,从而实现活动理解、时空定位和预测控制等下游任务。然而,由于自注意力的二次复杂度,程序视频包含这些模型不支持的具有远程依赖性的动作。例如,不同的动作可能在视觉上相似,尽管出现在过程中的不同点,例如打开和关闭炉子。在这里,我们提出了一种与主干网无关的方法,通过将问题简化为密集的、帧对齐的动作空间并预测池化掩蔽潜在向量来学习长时间视频表示。这种方法使我们的程序联合嵌入预测架构 (P-JEPA) 能够摄取超过 30 分钟的视频,从而能够有效地理解程序步骤。我们使用 VJEPA2.1、TSM 和 I3D 在 EgoExo4D、EgoProceL 和 Assembly101 数据集上提取的特征来评估 P-JEPA,发现它持续改进了线性可分离性、流推理和时间动作分割性能,在 EgoExo4D 细粒度动作分类上实现了最先进的结果,同时使用比基于 LLM 的方法少一个数量级的参数并在实际中运行时间。