论文

StenoVLA-3D:用于胃肠道狭窄导航的 3D 感知推理 VLA

StenoVLA-3D: 3D-Aware Reasoning VLA for Navigation Through Gastrointestinal Stenoses

摘要

自主内窥镜导航需要策略模型根据纹理贫乏的单眼观察来预测动作,做出安全的控制决策,并在病变离开视野后保留病变的证据。现有的视觉-语言-动作(VLA)模型主要依赖于视觉外观和短期上下文,限制了几何基础和情节级别的报告。我们介绍 StenoVLA-3D,这是一种用于在狭窄区域导航的 3D 感知 VLA 框架。我们通过学习的几何门控融合将点图集成到 Cosmos-Reason 2 主干中,并且还提出了一个时间状态分支来模拟遍历进度。我们的推理和行动骨干通过行动预测有根据的推理,而专门的负责人则估计狭窄形状并生成最终的病变报告。我们进一步介绍 EndoCausal,一个带有病变注释、动作和时间推理的事件级数据集。在 40 个保留的录制测试片段中,StenoVLA-3D 达到了 95.2% 的语义准确性和 83.4% 的动作准确性。在物理 3-DoF 内窥镜上,它在食管和结肠模型(各 36 次试验)中获得了 88.9% 和 77.8% 的任务成功率,大大优于评估的基线。