论文
HyperVLP:增强双曲空间中的分层手术视频语言 预训练
HyperVLP: Enhancing Hierarchical Surgical Video-Language Pre-training in Hyperbolic Space
摘要
外科视觉语言基础模型通常采用教育材料,例如外科讲座视频,将语言编码的外科知识转化为视觉表示。这些知识是多维和分层的:细粒度的动作线索出现在叙述中,中级关键步骤在小节标题中总结,全局程序背景(例如患者病史和手术策略)在抽象文本中描述。先前的工作很大程度上将这些异构信号折叠到单个平面嵌入空间中,隐含地假设跨层次结构的独立性。然而,这是次优的,因为它忽略了跨级语义包含,例如,动作属于步骤,步骤组成阶段,削弱了远程依赖建模。为此,我们提出了一种双曲外科视频语言 预训练 框架,该框架通过减轻程序上下文引起的结构性假阴性并强制父阶段与其组成子步骤之间的语义一致性来显式保留层次结构。对多个手术基准的广泛实验表明,跨手术和机构的零次和少次相位识别取得了一致的进展。