论文
LLM 生成的文本能否增强手术视觉语言 预训练 的能力?
Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?
摘要
自监督学习的最新进展催生了能够进行时空理解的强大手术视觉编码器。然而,将这些视觉基础扩展到多模态推理任务却受到专家文本注释成本高昂的严重瓶颈。为了克服这种可扩展性限制,我们引入了 \textbf{LIME},这是一个大规模多模态数据集,源自使用无人类、大语言模型 (LLM) 生成的叙述的开放访问手术视频。虽然 LIME 提供了巨大的可扩展性,但未经验证的生成文本可能包含错误,包括幻觉,这可能会导致标准对比管道中预先训练的医学先验发生灾难性的退化。为了缓解这个问题,我们提出了 \textbf{SurgLIME},这是一种参数高效的 Vision-Language 预训练 (VLP) 框架,旨在使用嘈杂的叙述来学习可靠的跨模式对齐。 SurgLIME 使用 LoRA 适应的双编码器架构保留基础医学先验,并引入自动置信度估计机制,在对比对齐期间动态降低不确定文本的权重。对 AutoLaparo 和 Cholec80 基准的评估表明,SurgLIME 实现了有竞争力的零样本跨模态对齐,同时保留了视觉基础模型稳健的线性探测性能。数据集、代码和模型可在 https://github.com/visurg-ai/SurgLIME 上公开获取。