论文

S3KL:用视觉基础模型结构先验改善少标签吞咽造影分割

Structure-aware Keypoint Localization for Videofluoroscopic Swallowing Study

应用与实践视觉感知与空间理解

摘要

吞咽电视荧光镜检查 (VFSS) 是诊断吞咽障碍的金标准之一,可提供吞咽过程的动态 X 射线成像。 VFSS 中的自动运动学分析从根本上依赖于精确的解剖关键点定位。然而,现有研究仅关注有限的关键点(例如颈椎或舌骨),而忽略了软腭等关键区域,同时仅注释活跃的吞咽节段而忽略了大量的非吞咽数据,导致数据效率较低。此外,通过标准的半监督学习利用这些未标记的数据并不是最理想的,因为通用方法容易出现空间偏差。在具有固定布局的医学 X 射线中,模型倾向于记住绝对坐标而不是理解解剖结构。为了应对这些挑战,我们引入了 VFSSKep,这是一个新颖的数据集,它将注释扩展到软腭并包含大规模未标记数据。我们进一步提出了 S$^3$KL,一种结构感知的半监督关键点定位框架,旨在克服空间偏差。它集成了结构感知学习策略,用于提取用于结构感知表示学习的高分辨率结构线索,以及具有块改组的结构表示一致性学习策略,以强制执行不变的结构识别。实验表明,我们的方法实现了最先进的半监督性能,即使使用未标记和 25% 标记数据也超越了使用 100% 标记数据的完全监督学习。代码和数据将公开于:https://github.com/kaai520/S3KL.

S3KL:用视觉基础模型结构先验改善少标签吞咽造影分割:论文原图
图 4:我们提出的 S3KL 框架的概述。我们提出的 S3KL 框架将简单的增强 $T_{e}$ 应用于未标记的图像以进行 教师模型 预测,并通过易到难的映射 $T_{e\to h}$ 转换为 学生模型 的伪标签。除了关键点监督之外,我们还提出了一种结构感知学习(SAL)策略来利用密集的解剖线索,通过将辅助预测头输出与结构配对模块的结构先验对齐来协助关键点定位。结构解析模块的输出使用 PCA [14] 进行可视化。此外,我们引入了结构表示一致性(SRC)学习策略,其中块洗牌操作扰乱空间结构,鼓励模型在存在此类扰动的情况下保持一致的表示。为了简单起见,省略了标记图像的 训练 过程。