论文

RefineRank:手术时空手术视频时空定位的关节盒细化和排名

RefineRank: Joint Box Refinement and Ranking for Surgical Spatio-Temporal Grounding

应用与实践行业应用

摘要

外科时空手术视频时空定位 (STG) 需要在程序问题指定的每个视频时间定位问题所询问的对象。现有方法面临着权衡:视觉语言模型理解问题上下文,但产生不精确的坐标,而开放集检测器提供本地化候选框,其置信度不能反映哪个框回答问题。我们引入了RefineRank,它缩小了候选框级别的这一差距。紧凑的可训练模块RefineNet将冻结医学视觉语言模型的语言和区域特征与冻结开放集检测器的建议相结合:它预测每个候选框的有界坐标校正和质量分数,并且固定解码规则返回具有最高分数的原始或精炼框。在 MedVidBench 官方排名(已验证)上,RefineRank 记录了 0.421 STG mIoU,这是显示的最高 STG 分数,而其全局多指标排名为 11。在对单独训练和评估视频的受控评估中,坐标校正将候选预言机上限从 0.6772 提高到 0.7302,并根据 RefineNet 分数对原始和精炼候选者的联合池进行排名,将 STG mIoU 从0.2719 到 0.4534,而同一池中单独训练的选择器最多可达 0.4186。这些结果表明,小型盒级模块可以协调问题理解与精确定位,而无需重新训练任一骨干网。代码可在 [https://github.com/linzhe001/RefineRank](https://github.com/linzhe001/RefineRank) 获取。