论文
SurgVLA-Bench:面向腹腔镜手术机器人的视觉-语言-动作模型评估
SurgVLA-Bench: Towards Evaluating Vision-Language-Action Models for Laparoscopic Surgical Robotics
摘要
视觉-语言-动作(VLA)模型代表手术机器人具身智能的有前景方向。尽管面向通用机器人的VLA基准盛行——专为手术情境设计的标准化评估平台仍缺席。为解决该局限——我们呈现SurgVLA-Bench——首个在腹腔镜手术机器人中评估VLA模型的综合基准。利用SurRoL仿真平台——我们构建从原子动作到完整手术程序的层级任务分类法——辅以评估动作精度与语义一致性的多维评估框架。随后系统评估两种代表性范式:自回归模型(如OpenVLA)与流匹配模型(如π₀、π₀.₅与SmolVLA)。实验表明自回归模型倾向在语义理解上出色——流匹配模型常达更高任务精度但可能面临泛化权衡。但即使最佳模型仍远不能令人满意——受限的内镜视野、受限视角与频繁遮挡仍是根本物理瓶颈。代码与数据见 https://github.com/VCL-HNU/SurgVLA。
