论文

癫痫症状学套件 (S3):用于理解癫痫症状学的临床多模态数据集、基准和模型

Seizure-Semiology-Suite (S3): A Clinically Multimodal Dataset, Benchmark, and Models for Seizure Semiology Understanding

模型评测基准与评测资源

摘要

虽然多模态 大语言模型 (MLLM) 在一般视频理解方面表现出了卓越的熟练程度,但它们解释非自愿和时空演变的病理运动行为(例如癫痫症状学)的能力在很大程度上尚未经过测试。为了解决这一差距,我们引入了 Seizure-Semiology-Suite,这是一个基于临床的数据集和细粒度、结构化癫痫症状学理解的基准。该数据集包括 438 个癫痫发作视频,注释有超过 35,000 个密集标签,涵盖 20 个 ILAE 定义的符号学特征。在此数据集的基础上,我们提出了一个七任务分层基准,系统地评估从低级视觉感知到时间排序、叙述报告生成和癫痫诊断的 MLLM。为了对生成的报告进行具有临床意义的评估,我们进一步引入了癫痫症状学报告质量指数 (Seizure-RQI)。 11 个开放权重 MLLM 的广泛基线揭示了偏侧推理、时间定位、症状排序和临床忠实报告方面的系统性弱点。我们表明,癫痫发作特异性 微调 显着提高了跨任务的表现,并且两阶段神经符号框架在癫痫发作与非癫痫发作分类上的 F1 得分为 0.96。 Seizure-Semiology-Suite 为评估安全关键型医疗视频理解中的多模态模型建立了严格的基准,并指导临床可靠、领域自适应多模态智能的开发。