论文

LaSeD:用于仅视觉手术阶段识别的标签语义自蒸馏

LaSeD: Label-Semantic Self-Distillation for Visual-Only Surgical Phase Recognition

摘要

手术阶段识别将每个视频帧映射到有临床意义的工作流程阶段,支持上下文感知帮助、记录和术后分析。大多数方法仅将相位注释视为类 ID,而最近的外科视觉语言模型通常需要额外的视频——文本数据、字幕或指令调整。我们提出 \emph{LaSeD},一种标签语义自蒸馏框架,它使用阶段名称作为特权训练时间上下文,同时保留仅视觉部署,而无需地面真实阶段名称提示。 LaSeD 从同一预训练的 VLM 检查点初始化冻结的教师和学生。教师收到框架、固定任务提示和真实相名提示;学生收到相同的帧和提示,但没有提示,仅对其视觉编码器进行了优化。训练将硬阶段词元监督与缓存教师表示的特征级蒸馏相结合。在推理时,教师和提示被删除,学生通过受约束的数字词元logits来预测七个 Cholec80 阶段之一,而无需额外的分类器头。在 Cholec80 评估中,LaSeD 实现了 86.20\% 的准确度、77.75\% 的宏召回率、78.13\% 的宏精度和 64.15\% 的宏 Jaccard。在相同的方案下,它分别将仅视觉的 Qwen3-VL-4B 基线提高了 9.45、9.42、11.93 和 12.22 个百分点。仅视觉意味着图像是唯一特定于样本的推理输入,而所有帧共享相同的固定任务提示。这些结果表明,阶段名称为使 VLM 适应手术工作流程分析提供了有用的低成本信号。 (代码即将发布。)