论文

EchoDino:用于整个生命周期可转移超声心动图分析的儿科基础模型

EchoDino: A pediatric foundation model for transferable echocardiographic analysis across the lifespan

应用与实践行业应用

摘要

超声心动图是最广泛使用的心脏成像方式,但解释需要整合整体解剖、局部结构和动态心脏运动的视觉证据。机器学习模型可以自动执行单独的任务,但它们通常是为单一目的而构建的,并且依赖于昂贵的标记数据集——这在儿科护理中尤其严重,因为数据稀缺,而且解剖结构随着年龄的增长而变化。在这里,我们介绍 EchoDino,这是一种自我监督的超声心动图基础模型,通过将 DINOv3 框架改编为来自 170 万个未标记儿科超声心动图视频的 370 万帧而创建。在编码器冻结的情况下,EchoDino 可以生成捕获全局上下文、局部解剖结构和密集空间细节的表示。我们引入运动偏置熵最大化采样 (MEMS) 来选择信息最丰富的帧进行视频级分析。在 9 个儿科和成人数据集中,EchoDino 的表现优于强大的基线模型,将视图分类精度从 0.609 提高到 0.889,将结构性心脏病检测的接收者操作特征曲线下面积从 0.811 提高到 0.872,同时还将年龄估计误差从 3.857 减少到 1.389 岁,实现了最佳分割精度并降低了射血分数误差。通过从无标签儿科数据推广到成人超声心动图,EchoDino 为整个生命周期的心脏图像分析提供了多功能基础。

EchoDino:用于整个生命周期可转移超声心动图分析的儿科基础模型的原论文方法或结果图
图 1:EchoDino 概述。 (a) EchoDino 使用 3,747,848 个未标记的儿科超声心动图框架改编 DINOv3 ViT-L 骨干模型。自监督训练跨增强视图对齐图像级表示以捕获全局采集上下文,预测蒙版补丁的教师模型特征以保留局部解剖结构,并在扩展训练期间保留补丁token之间的密集关系。 训练继续执行 300,000 步,最终的检查点用于所有下游评估。 (b) 基于帧的任务使用 EchoDino 的全局类token、本地补丁token或带有冻结编码器的多尺度中间特征。 (c) 对于基于视频的任务,轻量级时间模块聚合冻结帧表示以产生视频级预测。 (d) EchoDino 在基于帧和视频的任务中始终优于基线模型。 (e) EchoDino 准确地跨视图执行分割输出。虚线轮廓表示地面实况,填充区域显示模型预测。 (f) EchoDino 以预期的非线性方式预测各个儿科年龄组的年龄。 (g) 从同一视频中选择统一的 MEMS 帧。每帧上方的进度条指示其收缩期 (S) 和舒张期 (D) 之间的相对位置。与均匀帧采样相比,所提出的运动偏置熵最大化采样优先考虑具有大量运动的特征多样化帧。