论文
EndoNav:语言引导机器人内窥镜检查的语义到几何基础
EndoNav: Semantic-to-Geometric Grounding for Language-Guided Robotic Endoscopic Examination
摘要
在有限的解剖空间内进行的微创手术取决于连续的内窥镜可视化。当前的机器人内窥镜系统可以稳定或重新定位内窥镜,但它们不具备提供有效可视化帮助的相关背景。我们提出了 EndoNav,一种基于解剖学的自然语言框架,可将高级外科医生命令转化为患者特定鼻窦解剖结构中的自主内窥镜可视化行为。外科医生的口头命令由内窥镜视点代理根据患者特定的解剖场景表示进行转录和解释。视点代理不是直接生成机器人运动,而是生成结构化可视化目标,这些目标被转换为目标视点和检查轨迹,然后通过几何约束的内窥镜运动规划和关节空间控制来执行。我们使用结构化的三遍鼻窦检查对三个 CT 衍生的解剖模型进行评估。对于一具尸体标本,将自主可视化与两名住院外科医生进行的鼻窦检查进行比较。相对于两次外科医生检查,EndoNav 的平均可视化 IoU 为 87.04% 和 84.37%,而外科医生间 IoU 为 87.44%,同时恢复了外科医生观察的解剖表面的 92.91% 和 93.20%。这些结果证明了将高级解剖命令融入患者特定几何目标并将其转化为解剖学约束的机器人可视化行为的可行性。