论文
微调 多模式 大语言模型,用于通过家庭短视频进行临床医生级自闭症行为评分
Fine-tuning a multimodal large language model for clinician-grade autism behavioral scoring from short home videos
摘要
自闭症谱系障碍 (ASD) 影响着三分之一的美国儿童,但诊断时的中位年龄超过四岁。使用易于访问的观察数据(例如家庭视频)提供量化诊断的人工智能管道可以帮助早期诊断并及时提供早期治疗。我们在 400 个临床医生评级的家庭视频上对 Gemini 2.5 Pro 进行了微调,并进行了低秩适应,仅对先前经过验证的 30 个行为特征进行训练,以便在传递到各种 ML 模型时产生可靠的预测。在 99 名坚持不懈的儿童(49 名自闭症谱系障碍儿童,50 名神经典型儿童)中,临床医生的评估者间可靠性(每个特征加权的科恩卡帕)提高了 40% (p<0.001),其中 28 个可评估特征中有 27 个得到改善。作为一种新兴的零样本能力,直接 ASD 诊断 F1 提高了 53% (p<0.001),匹配或超过了临床医生的结果。使用微调的 LLM 衍生行为特征的分类器辅助管道与所有测试路径中临床医生评分的输入相匹配,并实现了 77% 的准确度(95% CI:68-85%)和 86%(95% CI:78-92%)的 AUC。微调的多模态 LLM 可用作可扩展的行为特征提取器,用于自闭症评估和诊断。