论文

具有层次意识的视频语言模型评估和手术双曲线基线

A Hierarchy-Aware Video-Language Model Evaluation and Hyperbolic Baseline for Surgery

模型评测基准与评测资源

摘要

外科手术遵循阶段到步骤的层次结构,但用于识别它们的视频语言模型是使用扁平的每级指标进行评估的,忽略了跨级一致性和错误结构。在本文中,我们为解决这个问题做出了两项贡献,(i)我们引入了 SurgHiBench,这是第一个用于手术视频理解的层次感知评估套件,其中三个任务测量跨粒度级别的识别、一致性和严重性。我们评估了通用 CLIP 模型、欧几里得手术模型,以及第二个贡献:(ii) HyperSurg,一种新的双曲线模型,通过涵盖锥体的四个(现有)数据集跨越三种手术类型强制执行相步遏制。该套件表明,具有相同精度的两个模型可以产生截然不同的错误严重性的预测,范围从正确阶段内的同级混淆到不相关的跨阶段预测。双曲几何将预测转向正确的程序邻域,并且这些增益随着每个数据集注释层次结构的树状性而缩放,从而在层次感知几何有所帮助时提供原则性指标。