论文
手术基础模型的扩展视频预训练
Scaling Video Pretraining for Surgical Foundation Models
摘要
手术视频理解对于计算机辅助干预至关重要,但现有的手术基础模型仍然受到数据规模有限、程序多样性和评估不一致的限制,通常缺乏可重复的训练流程。我们提出了 SurgRec,一种用于手术视频理解的可扩展且可重复的预训练方案,用两个变体实例化:SurgRec-MAE 和 SurgRec-JEPA。我们整理了一个包含 10,535 个视频和 2.145 亿帧的大型多源语料库,涵盖内窥镜检查、腹腔镜检查、白内障和机器人手术。在此语料库的基础上,我们开发了一个具有平衡采样的统一预训练流程,并标准化了 16 个下游数据集和四个具有一致数据分割的临床领域的可重复基准。通过与 SSL 基线和视觉语言模型的广泛比较,SurgRec 在下游数据集上始终实现了卓越的性能。相比之下,VLM 被证明对于细粒度时间识别来说并不可靠,表现出性能差距和对提示措辞的敏感性。我们的工作为社区构建更通用的手术视频模型提供了可重复、可扩展的基础。所有代码、模型和数据都将公开发布。