论文

MedHorizo​​n:走向野外长上下文医学视频理解

MedHorizon: Towards Long-context Medical Video Understanding in the Wild

模型评测基准与评测资源

摘要

医学多模态 大语言模型 (MLLM) 具有先进的图像理解和短视频分析,但真正的临床审查通常需要全过程视频理解。与一般的长视频不同,医疗过程包含高度冗余的解剖视图,而决定性的证据在时间上稀疏、空间上微妙且依赖于上下文。现有的基准通常假设这些证据已经通过图像、短片或预先分段的视频进行了本地化,从而导致推理前检索问题尚未得到测试。我们介绍 MedHorizo​​n,这是一个用于长上下文医学视频理解的野外基准。 MedHorizo​​n 保留了 759 小时的完整临床程序,并提供 1,253 个基于证据的多项选择题,共同评估稀疏证据理解和多跳临床推理。它的证据极其稀疏,平均只有 0.166% 的证据框架,要求模型在解释和汇总结果之前搜索嘈杂的程序流。我们评估了具有代表性的通用领域、医学领域和长视频 MLLM。最好的模型仅达到 41.1% 的准确度,这表明当前的系统距离强大的全过程理解还很远。进一步的分析得出了四个关键发现:随着帧数的增加,性能无法可靠地扩展,证据检索和临床解释仍然是主要瓶颈;这些瓶颈的根源在于弱程序推理和冗余下的注意力漂移,而通用采样方法只能部分平衡局部细节与全局覆盖。 MedHorizo​​n 为 MLLM 提供了严格的测试平台,可以检索稀疏证据并在完整的临床工作流程中进行推理。