论文

MacJEPA:在传感器间歇中断下保持第一视角音视频识别

MacJEPA: Missingness-Robust Audio-Visual Recognition from Untrimmed Egocentric Videos

模型评测鲁棒性、公平性与可信度评测

摘要

视听模型利用互补线索改善第一人称动作识别,但常假设推理时两条流均可用。既有缺失模态方法处理裁剪的单事件片段,整条流存在或缺失;真实传感器却会在长时间、未裁剪观测中故障和恢复。我们将缺失定义为未裁剪多事件观测中的局部时间传感器中断,整片缺失为极限情况。MacJEPA是缺失模态稳健的掩蔽上下文查询JEPA,根据给定区间查询在视听上下文中识别视觉动作和声音事件。训练时窗口局部模态丢弃模拟中断,将JEPA掩蔽从自监督辅助任务改成有监督稳健性目标,对齐多模态内容词元和任务条件查询的掩蔽与完整潜在表征。全部目标与识别联合单阶段优化,无需测试时适配。在Epic-Kitchens-100与Epic-Sounds上,一个检查点在完整输入下仍有竞争力,在主导或辅助流缺失时均超过已发布基线,以单模型兼顾未裁剪多事件视频的完整输入识别与时间局部缺失稳健性。

MacJEPA:在传感器间歇中断下保持第一视角音视频识别:论文原图
图 2:MacJEPA 训练 框架。窗口本地模态丢失会破坏具有类型化、定时掩码的在线多模态序列,而内容和查询 JEPA 将其与联合任务监督下的干净 EMA-教师模型 目标对齐。为了清楚起见,每个流显示了两个窗口和一个查询。