论文
多模态 大语言模型 可以理解病理性运动吗?癫痫症状学初步研究
Can Multimodal Large Language Models Understand Pathologic Movements? A Pilot Study on Seizure Semiology
摘要
多模态 大语言模型 (MLLM) 在识别人类日常活动方面表现出了强大的能力,但其分析神经系统疾病中具有临床意义的不自主运动的潜力在很大程度上尚未被开发。该试点研究评估了 MLLM 自动识别癫痫视频中病理运动的能力。我们评估了最先进的 MLLM 在 90 个临床癫痫记录中的 20 个 ILAE 定义的症状学特征上的零样本性能。 MLLM 在 18 个特征中的 13 个特征上优于微调的卷积神经网络 (CNN) 和 Vision Transformer (ViT) 基线模型,无需进行特定任务的训练,在识别显着姿势和上下文特征、同时应对微妙的高频运动方面表现出独特的优势。以特征为目标的信号增强(面部裁剪、姿势估计、音频去噪)提高了 20 个特征中的 10 个特征的性能。专家评估表明,MLLM 对正确预测病例生成的解释中有 94.3% 达到了至少 60% 的 忠实性 分数,与癫痫学家的推理一致。这些发现证明了通过有针对性的预处理策略将通用 MLLM 用于专业临床视频分析的潜力,为可解释、高效的诊断辅助提供了一条途径。我们的代码可在 https://github.com/LinaZhangUCLA/PathMotionMLLM 上公开获取。