表格机器学习的少样本跨国推广和分布变化下儿童贫血预测的基础模型
Few-shot Cross-country Generalization of Tabular Machine Learning and Foundation Models for Childhood Anemia Prediction under Distribution Shift
摘要
儿童贫血影响全球约 40% 的 6-59 个月儿童,并且由异质因素引起,限制了模型的普遍性。我们在跨国和数据稀缺的环境下对照经典监督方法评估基于 Transformer 的表格基础模型。我们使用了来自非洲、亚洲、拉丁美洲、高加索和中东 16 个国家的 DHS 数据 (n=68,856)。我们比较了 Logistic 回归、XGBoost、LightGBM 和 TabPFN v2.6。使用 AUC-ROC、Brier 评分和 ECE 评估表现。使用留一国家排除 (LOCO)、反向 LOCO 和少样本设置来评估泛化能力。亚组分析包括性别、年龄、居住地、母亲教育程度和财富。使用 SHAP 估计特征重要性。 TabPFN 在低数据范围(<200 个样本)中优于经典模型,表现出更高的辨别力和更好的校准。在各个国家中,它获得了最低的 Brier 分数 (0.042) 和 ECE (0.203)。在完整数据设置下,AUC-ROC 范围为 0.59-0.76,模型间差异较小 ($\leq 0.05$)。在国家背景的推动下,LOCO 表现稳定(0.58-0.69)。 Reverse-LOCO 显示出不对称可转移性。亚组表现一致,不存在系统性人口统计学偏差。 SHAP 将儿童年龄、海拔高度和年龄别身高 z 值确定为主要预测因素,其次是财富和母亲教育程度。儿童贫血预测的表现更多地是由群体变异而非模型选择决定的。 TabPFN 通过改进的辨别和校准在资源匮乏的环境中提供优势,强调基础模型作为数据稀缺的全球健康预测的有前途的工具。