论文

基于28万份常规报告的报告锚定结肠镜视觉-语言基础模型

A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports

模型训练预训练

摘要

尽管常规报告中记录了丰富的专家描述,视觉-语言模型在结肠镜领域仍利用不足。这些报告记录了病灶的外观、大小与位置,但它们总结的是整个检查过程而非为单帧图像配文,导致临床发现与对应图像之间只有微弱的关联。我们开发了EndoCLIP,这是一个结肠镜视觉-语言基础模型,其训练数据为从280,476份常规结肠镜记录中逐步恢复出的125,756个病灶级图文对。在病灶级图文检索、结构化报告生成以及六项多中心临床分类任务上,EndoCLIP在零样本与线性探测两种设置下均优于通用及生物医学视觉-语言编码器。在良恶性分类上,其线性探测在一项涉及12名内镜医师的盲法研究中接近专家读片者的水平。这些结果表明,恢复发现与帧之间的对应关系可将常规文档转化为可扩展的监督信号,使临床目标能以语言方式指定,而无需为每个任务单独标注。

基于28万份常规报告的报告锚定结肠镜视觉-语言基础模型:论文配图
图 1:弱报告——预训练数据集的图像对齐和分析。 a,常规报告对应于多帧、通常是多病变病例。 b,数据集管理漏斗,从 280.5k 去识别报告到 123.8k 息肉阳性报告和 104.5k 病例 (37.3%) 的精选训练集,产生 125.8k 图像文本对。 c,123.8k 息肉报告的解剖部位覆盖范围。 d,形态和表面描述符的频率。 e,病灶大小分布。 f,报告并发现句子长度(以单词为单位)。 g,每个案例的帧数(n = 123.8k 案例,854 万帧;中位数 65,平均值 69)。在 e–g 中,条形标记分布百分位数 (P25–P99)。