论文

Co-Annotator:专家蒸馏的ViT与视觉语言模型,为年龄相关性黄斑变性提供视觉及文档指导

Co-Annotator: Expert-Distilled ViT and VLM for Visual and Documentation Guidance in Age-Related Macular Degeneration

摘要

临床人工智能通常会优化预测性能,而不涉及临床医生如何决定在哪里查看和写什么。我们提出了 Co-Annotator,它将专家凝视和听写提炼为两个指导组件:一个凝视对齐的视觉转换器,产生注视对齐的感兴趣区域(AOI),以及一个本体限制的视觉语言模型(VLM),它预先填充用于视网膜光学相干断层扫描(OCT)的可编辑生物标记摘要。我们首先收集专家的注视和听写 (US1) 来训练模型,显着提高诊断准确性和生物标志物生成。然后,我们与眼科住院医师一起部署该系统:一项受控住院医师研究 (US2) 证实每种方式都是安全且独立有益的,AOI 指导通过指导后结转和 VLM 指导产生持久的感知效率增益,使生物标志物文档宽度增加一倍以上。在两个学术机构 (US3) 的联合部署中,同时提供两种模式所产生的效率增益大大超过了单独使用任何一种模式:每分钟的正确诊断数增加了 40%,评论编辑时间减少了 67%,同时不影响诊断准确性。值得注意的是,两种模式在 US2 的指导期间都没有提高效率,这使得 US3 的联合指导下的指导效率增益更为引人注目。专家提炼的多模态指导可以同时消除两个不同的临床工作流程瓶颈(视觉搜索开销和文档负担),而不会影响临床医生已经达到的诊断准确性。