论文
通过结构化基础模型自适应实现图像引导导航的几何一致内窥镜表示
Geometry-Consistent Endoscopic Representations for Image-Guided Navigation via Structured Foundation Model Adaptation
摘要
由于深度线索有限、组织纹理薄弱、非刚性变形以及跨域的显着外观变化,单眼内窥镜中基于视觉的精确导航很困难,所有这些都使姿势估计、深度预测和图像与解剖结构对齐变得复杂。尽管最近的视觉基础模型已经显示出希望,但它们学习到的表示通常仍然不够几何一致,阻碍了稳定的特征对应并限制了它们在下游导航任务中的可靠性。我们提出了一个统一的框架,用于学习单眼内窥镜的几何一致和域鲁棒的图像表示。该框架将提供精确几何监督的合成数据管道与层次感知几何语义适应相结合,这是标准 LoRA 的结构化替代方案,可在 Transformer 层次结构中选择性地插入低秩适配器,并将它们与分层训练目标结合起来,以鼓励中间特征中的几何对应和更深层次特征中的语义一致性。对公共和专有数据集的实验表明,几何和语义表示质量得到了提高,从而在下游导航任务(包括姿态估计和单目深度估计)上获得了更好的性能。学习到的表示显示了临床支气管镜检查中良好的合成到真实的转换,并为在有限监督下适应鼻窦内窥镜检查和结肠镜检查提供了有用的初始化。该框架还显示了模型大小和训练数据的良好扩展性。这些结果支持层次感知、几何引导的适应作为内窥镜表征学习的实用方法。