论文

TabBench-Bio:高维生物医学表上机器学习的活基准

TabBench-Bio: A Living Benchmark for Machine Learning on High-Dimensional Biomedical Tables

模型评测基准与评测资源

摘要

生物医学表格通常将数千个测量变量与仅数十或数百个标记样本结合起来,这种情况在通用表格基准中很难得到体现。我们推出 TabBench-Bio,这是一个涵盖多个领域的 43 个生物医学数据集的实时交互式基准。在共享交叉验证协议下,我们比较了 28 个逐个特征操作点的经典估计器、神经网络和表格基础模型。在 10,000 个特征和 100 个训练样本的参考单元中,RealTabPFN v2.5 的点估计最高,其次是 Logistic 回归和 TabDPT,其点估计几乎相同。目标池上的配对引导程序将 RealTabPFN v2.5 与 Logistic 回归分开 145 Elo(95% 区间 [59, 232])。表格基础模型通常占据领先地位,而最强的配置取决于操作点和生物医学模式。 AutoML 框架 AutoGluon 使用其一小时“极限”预设,被配置为单独的资源密集型参考,并在参考单元格中进行报告。折叠级预测、运行状态和确定性聚合使每个报告的结果都可重复和可重用。我们邀请社区做出贡献:TabBench-Bio 旨在不断发展,我们欢迎提交新的生物医学表格数据集,特别是来自代表性不足的测定和临床终点的数据集,以便包含在未来的版本中。交互式排行榜位于:https://tabbench-bio.eu