论文
EchoPilot:通过尺度空间语义提示和可靠性门控内存进行 无需训练 超声视频分割
EchoPilot: Training-Free Ultrasound Video Segmentation via Scale-Space Semantic Prompting and Reliability-Gated Memory
摘要
超声视频分割具有临床价值,但由于散斑噪声、弱边界和快速解剖变形而困难。最近的可提示基础模型支持点引导分割,但它们在超声中的直接部署仍然不可靠:单个点提供的空间上下文不足以解决尺度模糊性,而贪婪的内存更新将早期错误放大为严重的时间漂移。我们提出了 EchoPilot,这是一个 无需训练 框架,用于稀疏第一帧交互下的超声视频分割,仅需要单点单击和解剖类别名称。 EchoPilot 协调用于语义定位的冻结医学视觉语言模型 (VLM)、用于密集几何特征提取的视觉基础模型 (VFM) 以及用于掩模预测和传播的提示视频分段器。为了解决初始化歧义,我们提出了尺度空间语义提示,它首先通过无参数 S.E.E.D 选择最佳上下文视图。 (语义能量-熵密度)准则,然后从密集的基础特征中合成几何精确的辅助点提示,无需额外的用户交互。为了减少传播漂移,进一步引入了可靠性门控内存更新,以在不确定的预测下选择性地冻结分段器的内存库,防止错误累积。我们还贡献了第一个动态胎儿胎盘超声视频分割数据集,包含 671 个带注释的帧。在三个超声视频数据集上,EchoPilot 在稀疏交互设置下实现了最先进的性能,始终优于 无需训练 基线和微调专家。