论文
ClipPPER:针对事件识别的长篇术中手术程序的上下文视频语言预训练
CliPPER: Contextual Video-Language Pretraining on Long-form Intraoperative Surgical Procedures for Event Recognition
摘要
视频语言基础模型已被证明在各种任务的零样本应用中非常有效。一个特别具有挑战性的领域是术中外科手术领域,其中标记数据稀缺,并且复杂的下游任务通常需要精确的时间理解。为了应对这一挑战,我们引入了 CliPPER(用于事件识别的长格式术中手术程序的上下文视频语言预训练),这是一种在外科讲座视频上进行训练的新型视频语言预训练框架。我们的方法专为细粒度时间视频文本识别而设计,并引入了几种新颖的预训练策略来改善长格式手术视频中的多模态对齐。具体来说,我们提出了上下文视频文本对比学习(VTC_CTX)和剪辑顺序预测(COP)预训练目标,这两个目标都利用时间和上下文依赖性来增强本地视频理解。此外,我们在同一手术视频中的视频文本匹配上结合了循环一致性对齐,以强制双向一致性并提高整体表示一致性。此外,我们引入了更精细的对齐损失,帧文本匹配(FTM),以改善视频帧和文本之间的对齐。因此,我们的模型在多个公共外科基准上建立了新的最先进技术,包括阶段、步骤、仪器和三元组的零样本识别。源代码和预训练说明可以在 https://github.com/CAMMA-public/CliPPER 找到。