论文
用于机器人血管内导丝导航的上下文感知奖励建模的视觉语言程序推理
Vision-Language Procedural Reasoning for Context-Aware Reward Modeling of Robotic Endovascular Guidewire Navigation
摘要
机器人辅助血管内介入治疗需要在复杂且针对患者的血管解剖结构中进行准确、稳定和上下文感知的导丝导航。尽管最近在机器人精度和基于学习的控制方面取得了进展,但现有的自主导航方法仍然受到对静态奖励函数的依赖以及缺乏有关解剖背景和任务进展的明确程序推理的限制。为了应对这些挑战,本文提出了一种用于自主导丝导航的视觉语言程序推理(VL-PR)框架。该框架集成了多模态 大语言模型 (MLLM) 作为程序推理模块,可解释实时视觉观察结果以推断高级导航上下文。推断的程序见解不是生成底层控制命令,而是通过动态调整不同导航阶段奖励组件的重要性来实现上下文感知奖励适应。这种方法允许单一策略来解决相互竞争的目标并处理复杂的过渡,同时保持一致的全局任务目标。在不同血管场景的物理机器人平台上进行的实验证明了任务可靠性的增强和导航效率的简化,凸显了相对于静态奖励方法的优势,并为复杂的多任务机器人血管内手术提供了可扩展的解决方案。