论文

关于手术内窥镜视频的时间视觉语言模型的鲁棒性

On the Robustness of Temporal Vision-Language Models for Surgical Endoscopy Videos

模型评测鲁棒性、公平性与可信度评测

摘要

时间视觉语言模型 (TVLM) 为手术视频理解提供了可重用、基于提示的界面,但在内窥镜检查中临床真实采集伪影下的鲁棒性仍然没有得到充分表征。在实践中,诸如散焦、雾霾、运动模糊、噪声、烧灼烟雾和数据包丢失等降级会引入结构化分布变化,这可能会损害视频文本对齐。我们研究了在由剪辑帧损坏引起的这种变化下时间 VLM 的鲁棒性。我们引入了 Endo-C6,这是一种紧凑的腐败基准,以固定的高严重性评估六种内窥镜真实扰动,并将其应用于公共胃肠 (GI) 内窥镜检查和腹腔镜胆囊切除术视频。根据标准化提示协议,我们对 3 个最近的外科 TVLM 基线进行了基准测试,并分析了平均和最坏情况设置下的稳健性,涵盖 294 个数据集级评估。最后,我们提出了 RobustEndoCLIP,它是通过使用 VeRA 进行几次参数高效调整而获得的,其性能优于现有的 TVLM 基线。我们的研究结果表明,现成的 TVLM 在内窥镜特定损坏情况下可能会表现出严重的最坏情况崩溃,而轻量级几次适应可以在不改变基于提示的界面的情况下显着改善损坏的性能和鲁棒性。我们期望 Endo-C6 支持标准化稳健性报告并促进更​​可靠的临床视觉语言系统。