论文
一种丰富手术视频数据集以细粒度时空理解视觉语言模型的方法
An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models
摘要
手术视频理解是推进计算机辅助手术的重要先决条件。虽然视觉语言模型(VLM)最近已应用于外科领域,但现有的外科视觉语言数据集缺乏捕获和评估复杂的、交错的时空动态。由于昂贵的手动注释或使用 大语言模型 生成容易出错,创建准确表示手术视频中细粒度时空关系的大规模数据集具有挑战性。为了解决这一差距,我们引入了 SurgSTU-Pipeline,这是一种确定性生成管道,具有时间和空间连续性过滤功能,可以可靠地创建手术数据集,以实现细粒度的时空多模态理解。将此流程应用于公开的手术数据集,我们创建了 SurgSTU 数据集,其中包含 6711 个视频剪辑,密集扩展了 15 万个细粒度时空问答样本。我们的综合评估表明,虽然最先进的通才 VLM 在零样本设置中举步维艰,但它们的时空能力可以通过上下文学习来提高。 SurgSTU 训练数据集上经过微调的 VLM 在所有时空任务中实现了最高性能,验证了该数据集在提高手术视频中 VLM 时空理解方面的功效。该项目可在此处获取:https://lennart-maack.github.io/SurgSTU-project