论文

SiMing-Bench:通过临床技能视频中的连续交互评估程序的正确性

SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos

模型评测基准与评测资源

摘要

当前多模态 大语言模型 (MLLM) 的视频基准侧重于事件识别、时间排序和长上下文回忆,但忽略了专家程序判断所需的更难的功能:跟踪正在进行的交互如何更新程序状态,从而确定后续操作的正确性。我们推出了 SiMing-Bench,这是第一个通过完整的临床技能视频评估这种能力的基准。它的目标是基于规则的流程级判断,判断交互驱动的状态更新是否在整个工作流程中保持程序的正确性。 SiMing-Bench 使用 SiMing-Score 进行实例化,SiMing-Score 是由医生注释的真实临床技能检查视频数据集,涵盖心肺复苏、自动体外除颤器操作和球囊面罩通气,每个视频都配有标准化的逐步评分细则和双专家标签。在不同的开源和闭源 MLLM 中,我们观察到与医生判断的一致程度始终较弱。此外,即使总体程序级相关性似乎可以接受,评估规则定义的中间步骤的弱性能仍然存在,这表明粗略的全局评估大大高估了当前模型的程序判断能力。使用二元步骤判断和步骤对齐剪辑进行的其他分析表明,瓶颈不仅仅是细粒度评分或时间定位,而是对连续交互如何随时间更新程序状态进行建模。