论文

SurgVLA-Bench:面向腹腔镜手术机器人的视觉-语言-动作模型评估

SurgVLA-Bench: Towards Evaluating Vision-Language-Action Models for Laparoscopic Surgical Robotics

智能体系统Agent任务评测

摘要

视觉-语言-动作(VLA)模型代表手术机器人具身智能的有前景方向。尽管面向通用机器人的VLA基准盛行——专为手术情境设计的标准化评估平台仍缺席。为解决该局限——我们呈现SurgVLA-Bench——首个在腹腔镜手术机器人中评估VLA模型的综合基准。利用SurRoL仿真平台——我们构建从原子动作到完整手术程序的层级任务分类法——辅以评估动作精度与语义一致性的多维评估框架。随后系统评估两种代表性范式:自回归模型(如OpenVLA)与流匹配模型(如π₀、π₀.₅与SmolVLA)。实验表明自回归模型倾向在语义理解上出色——流匹配模型常达更高任务精度但可能面临泛化权衡。但即使最佳模型仍远不能令人满意——受限的内镜视野、受限视角与频繁遮挡仍是根本物理瓶颈。代码与数据见 https://github.com/VCL-HNU/SurgVLA。

SurgVLA-Bench:面向腹腔镜手术机器人的视觉-语言-动作模型评估:论文配图
图 1:SurgVLA-Bench 概述。左图展示了微调和部署流程,其中预训练的 VLA 模型通过 LoRA 进行微调并部署在 SurRoL 模拟环境中。右侧面板显示了跨越三个难度级别的分层任务分类:原子任务、条件任务和复合任务。