论文

划分然后诊断:为超长胶囊内窥镜视频编织受临床医生启发的背景

Divide-then-Diagnose: Weaving Clinician-Inspired Contexts for Ultra-Long Capsule Endoscopy Videos

模型评测基准与评测资源

摘要

胶囊内窥镜(CE)可以实现非侵入性胃肠道筛查,但目前的CE研究仍然主要局限于帧级分类和检测,而视频级分析尚未得到充分探索。为了弥补这一差距,我们引入并正式定义了一项新任务,即诊断驱动的 CE 视频摘要,它需要提取涵盖临床有意义的发现的关键证据框架,并从这些证据框架中做出准确的诊断。这种设置具有挑战性,因为与诊断相关的事件极其稀疏,并且可能被数以万计的冗余正常帧所淹没,而由于运动模糊、碎片、镜面高光和快速视点变化,个体观察通常是不明确的。为了促进这一方向的研究,我们引入了 VideoCAP,这是第一个具有源自真实临床报告的诊断驱动注释的 CE 数据集。 VideoCAP 包含 240 个完整长度的视频,为关键证据框架提取和诊断提供真实的监督。为了解决这一任务,我们进一步提出了 DiCE,这是一个受临床医生启发的框架,反映了标准 CE 阅读工作流程。 DiCE 首先对原始视频进行高效的候选筛选,然后使用上下文编织器将候选者组织到连贯的诊断上下文中,以保留不同的病变事件,并使用证据聚合器将每个上下文中的多帧证据聚合成强大的剪辑级判断。实验表明,DiCE 始终优于最先进的方法,可生成简洁且临床可靠的诊断摘要。这些结果凸显了诊断驱动的上下文推理作为超长 CE 视频摘要的有前途的范例。