论文
基于28万份常规报告的报告锚定结肠镜视觉-语言基础模型
A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports
摘要
尽管常规报告中记录了丰富的专家描述,视觉-语言模型在结肠镜领域仍利用不足。这些报告记录了病灶的外观、大小与位置,但它们总结的是整个检查过程而非为单帧图像配文,导致临床发现与对应图像之间只有微弱的关联。我们开发了EndoCLIP,这是一个结肠镜视觉-语言基础模型,其训练数据为从280,476份常规结肠镜记录中逐步恢复出的125,756个病灶级图文对。在病灶级图文检索、结构化报告生成以及六项多中心临床分类任务上,EndoCLIP在零样本与线性探测两种设置下均优于通用及生物医学视觉-语言编码器。在良恶性分类上,其线性探测在一项涉及12名内镜医师的盲法研究中接近专家读片者的水平。这些结果表明,恢复发现与帧之间的对应关系可将常规文档转化为可扩展的监督信号,使临床目标能以语言方式指定,而无需为每个任务单独标注。
