论文

HeiCo-FOCUS:长时手术视频理解数据集

HeiCo-FOCUS: A Clinically Grounded Dataset for Long-Context Video Understanding

模型评测应用与实践基准与评测资源行业应用通用理解与问答

摘要

视觉语言模型 (VLM) 的最新进展使得视频理解在各种基准任务中取得了快速进展。然而,现有的评估主要侧重于短期推理,未能评估关键能力:在较长时间范围内保持累积时间一致性。为了弥补这一评估差距,我们引入了 HeiCo-FOCUS,这是一个基于临床的数据集,用于通过手术中的异物上下文理解任务来评估长上下文视频理解。该任务基于海德堡结直肠手术的数据集,要求模型在持续长达数小时的手术过程中连续跟踪多个对象的插入、操作、遮挡和移除。 HeiCo-FOCUS 包含 30,000 个视觉问答 (VQA) 对,涵盖五项核心功能:对象识别、时间基础、聚合、事件和程序理解以及复杂推理。该数据集是通过严格的多阶段注释流程构建的,涉及大规模人群注释和 39 个手术领域 专家确保高质量和临床相关性。为了系统地探索模型行为,我们引入了一个多轨评估框架,该框架逐渐增加从单帧到完整程序的时间和上下文需求。对 10 个前沿 VLM 进行的实验表明,HeiCo-FOCUS 任务还远未解决:只有大约一半的模型明显优于纯文本基线。在所有视频轨道中,模型在事件和程序理解方面表现最佳(所有模型的平均准确度:56.5%),而时间基础对于所有评估的模型来说仍然特别具有挑战性(平均准确度:19.7%)。因此,我们期望 HeiCo-FOCUS 能够成为开发能够在长达数小时的视频中进行可靠、时间一致推理的模型的催化剂。

HeiCo-FOCUS:长时手术视频理解数据集:论文原图
图 1:HeiCo-FOCUS 基准测试概述。 a) 临床动机。确保在手术结束时取出异物至关重要,因为残留的异物可能会导致严重的并发症。 b) 数据集概述。该数据集包含 96 小时的手术视频,并带有 30,000 个视觉问答 (VQA) 对,涵盖五个核心功能(见图 2)。