论文
MedVLA:闭环精密医疗机器人操作的分层视觉-语言-动作框架
MedVLA: A Hierarchical Vision-Language-Action Framework for Closed-Loop Precision Medical Robot Manipulation
摘要
精密医疗机器人需要在严格的安全性、可解释性和执行约束下做出自适应决策。尽管最近的视觉-语言-动作(VLA)模型显示出强大的多模态推理能力,但它们的连续动作生成范式不太适合精确的医疗任务,其中可靠的闭环操作也可能依赖于非动作系统函数调用。为了解决这一差距,我们提出了 MedVLA,这是一种将高级多模态推理与低级功能约束执行相结合的分层框架。我们进一步引入可扩展的多代理管道来生成面向技能的思想链(CoT)数据以进行结构化训练。 MedVLA 基于不同的多模态大模型主干构建,在微调后不断提高性能,证明了所提出的框架跨模型变体的有效性。在相同的初始条件下,我们进行了 100 次闭环柔性电极植入试验。结果表明,MedVLA 实现了 95.0\% 的任务成功率,在准确性、稳定性和安全性方面大大优于代表性 VLA 基线,包括 OpenVLA (8\%) 和 $\pi_0$ (15\%)。这些结果表明,具有约束功能级执行的结构化推理是实现可部署精密医疗机器人的实用途径。