论文
S3KL:用视觉基础模型结构先验改善少标签吞咽造影分割
Structure-aware Keypoint Localization for Videofluoroscopic Swallowing Study
摘要
吞咽电视荧光镜检查 (VFSS) 是诊断吞咽障碍的金标准之一,可提供吞咽过程的动态 X 射线成像。 VFSS 中的自动运动学分析从根本上依赖于精确的解剖关键点定位。然而,现有研究仅关注有限的关键点(例如颈椎或舌骨),而忽略了软腭等关键区域,同时仅注释活跃的吞咽节段而忽略了大量的非吞咽数据,导致数据效率较低。此外,通过标准的半监督学习利用这些未标记的数据并不是最理想的,因为通用方法容易出现空间偏差。在具有固定布局的医学 X 射线中,模型倾向于记住绝对坐标而不是理解解剖结构。为了应对这些挑战,我们引入了 VFSSKep,这是一个新颖的数据集,它将注释扩展到软腭并包含大规模未标记数据。我们进一步提出了 S$^3$KL,一种结构感知的半监督关键点定位框架,旨在克服空间偏差。它集成了结构感知学习策略,用于提取用于结构感知表示学习的高分辨率结构线索,以及具有块改组的结构表示一致性学习策略,以强制执行不变的结构识别。实验表明,我们的方法实现了最先进的半监督性能,即使使用未标记和 25% 标记数据也超越了使用 100% 标记数据的完全监督学习。代码和数据将公开于:https://github.com/kaai520/S3KL.
