论文

woma:用于内窥镜检查的实时基础模型及其微调模型

woma: a real-time foundation model and its fine-tuned models for endoscopy

模型训练预训练

摘要

woma 是胃肠道内窥镜检查的实时基础模型:一个在大约一百万个内窥镜检查帧上进行无标签训练的网络,从中对任务模型进行微调。我们为生产提供系统设计。要求和及格分数在任何运行之前都已确定,根据预先注册的规则筛选八名候选人,按照停止规则进行自我监督训练,然后进行微调和部署优化,所有这些都在一个独立的库 numbat 上进行。我们还为 woma 本身提供了两个经过微调的模型,报告的每个结果都达到或未达到。我们的结肠镜检查模型发现并勾勒出息肉的轮廓,对所看到的结肠段进行命名,提示息肉类型并对肠道准备进行分级。我们的胃镜检查模型从 22 个协议站点中命名了一个站点,标记并概述了病变,并命名了七个发现之一。每个数字都是根据训练中从未见过的数据读取的,并根据该记录选择运输重量。在结肠镜检查中,六家医院 PolypGen 组中 96% 的息肉被发现精度 >=0.85,并且在 15 个完整 REAL-Colon 视频中的 19 个息肉中,有 19 个在每次手术中有 1.6 个误报。在胃镜检查中,来自未见过的患者的 92% 的帧中的标志性区域被正确命名,并且 39 个保留的肿瘤帧中的 37 个以特异性 0.91 被标记。在一个工作站 GPU 上,每个任务以每秒约 100 帧的速度运行超过 1080p 的视频,在所有四种测试精度范围内比 PyTorch、ONNX Runtime 和 TensorRT 更快。 TensorRT 最接近:我们的基础模型的一次传递比我们的模型要长 3% 到 27%,而且我们每秒从帧到结果的帧数要多 6% 到 31%。第二个构建根本不链接任何供应商库(我们自己的 Vulkan 内核),因此站点部署两个文件,不需要工具包、cuDNN 和框架;在 f32 中,它击败了在同一张卡上构建的 CUDA。