论文

ASD-Bench:自闭症谱系障碍人工智能模型的四轴综合基准

ASD-Bench: A Four-Axis Comprehensive Benchmark of AI Models for Autism Spectrum Disorder

模型评测基准与评测资源

摘要

自动自闭症谱系障碍筛查工具仍然受到单一架构评估、轴限制评估和几乎完全关注成人群体的限制,从而模糊了对早期干预至关重要的特定年龄诊断模式。我们引入了 ASD-Bench,这是一个系统的表格基准,在四个轴上评估三个年龄组(1-11 岁儿童、12-16 岁青少年、17-64 岁成人)的机器学习、深度学习和基础模型配置:预测性能、校准、可解释性和对抗鲁棒性。我们的基准测试应用于包含 4,068 个 AQ-10 记录的 v3 数据集,涵盖经典模型(XGBoost、AdaBoost、随机森林、Logistic 回归)、神经网络 (MLP)、深度表格 Transformer(TabNet、TabTransformer、FT-Transformer)和 TabPFN v2。我们引入启发式聚合惩罚(HAP):一种对成本敏感的指标,对漏报进行更严厉的惩罚,并结合交叉验证方差来提高部署稳定性。成人分类具有较高的性能(10/17 模型实现了完美的 F1 和 AUC),而青少年则面临着更艰巨的任务(F1 上限为 0.837,儿童为 0.915)。特征层次在不同群体之间发生变化:A9(社交动机)在儿童中占主导地位,A5(模式识别)在青少年中占主导地位,而成年人则表现出与发展性社交掩蔽一致的更平坦的重要性特征。准确性和校准是分离的:AdaBoost 在 ECE=0.302 的成人上实现了 F1=1.000,证实单一指标评估不足以用于临床 AI。提供了针对特定群组的部署建议。所有发现均应被解释为问卷衍生标签的概念验证证据,而不是经过临床验证的诊断性能。