论文
提取结构化健康数据的表格基础模型
Distilling Tabular Foundation Models for Structured Health Data
摘要
表格基础模型 (TFM) 在健康数据集上实现了强大的性能,但其推理成本和基础设施要求限制了实际使用。我们研究是否可以通过 知识蒸馏 将它们的预测行为转移到轻量级表格模型。由于上下文中的 TFM 在推理时以训练集为条件,因此简单的 蒸馏 可能会引入上下文泄漏;我们通过分层的折叠式教师标签来解决这个问题。在 19 美元的医疗数据集、6 美元的 TFM 教师、4 美元的学生家庭和几个多教师集合中,我们发现经过蒸馏的学生保留了至少 90%$ 的教师 AUC,在某些情况下优于教师,同时在 CPU 上运行速度至少提高了 26 倍,并保持了对健康应用程序至关重要的校准和公平性。此外,多位教师的平均成绩并不能持续优于最好的单一教师。因此,泄漏感知 蒸馏 是将 TFM 质量预测引入推理约束健康环境的可行途径。