论文
MedStreamBench:流媒体和主动医疗视频理解的时间感知基准
MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding
摘要
现有的医学视频基准主要评估模型是否产生正确的答案,但很少评估其是否在正确的时间给出答案。在真实的临床环境中,人工智能系统不仅必须决定预测什么,还必须决定何时回答、推迟判断或主动发出警报。这在基准评估和部署要求之间造成了严重差距。我们推出了 MedStreamBench,这是时间感知医疗视频理解的基准。 MedStreamBench 集成了 22 个医疗数据集和 5,419 个 QA 实例,涵盖四种时间设置:回顾性、当前、未来和主动。与假设全视频访问的传统基准不同,MedStreamBench 将模型限制在时间有限的证据窗口内,并支持单轮和流式评估。我们进一步引入了主动监控设置,需要模型来确定是否以及何时应触发临床相关警报。除了答案正确性之外,MedStreamBench 还通过响应性和事后稳定性来评估时间行为。对领先的通用和医学视觉语言模型的实验揭示了离线识别和基于时间的决策之间存在巨大差距,在流媒体和主动设置中性能显着下降。我们的基准测试可在 https://huggingface.co/datasets/Venn2024/MedStreamBench 上找到。