论文

PhenoBench:绘制深度表型人类队列可以告诉我们什么

PhenoBench: Mapping What a Deeply Phenotyped Human Cohort Can Tell Us

模型评测基准与评测资源

摘要

深度表型队列结合了从几秒到几年的时间尺度上的临床、成像、分子和可穿戴观察,但异质性分析不能直接比较。我们推出了 PhenoBench,这是一个可执行的基准测试,它将深度表型测量转化为明确的问题,并对信息源和预测模型进行受控比较。它是围绕人类表型项目建立的,首次访问时有超过 13,000 名参与者。每个问题都确定了目标、人群、时间和允许的信息;其评估合同指定了分割、指标、基线和声明边界。 PhenoBench 定义了 15 个领域和 26 种输入模式的 90 项临床基础任务。在跨越 52 个任务的 160 个匹配回归比较中,在具有有限调整的固定单估计器协议下,六个预训练的表格模型排名高于评估的特定于任务的基线,包括 XGBoost 和 CatBoost。给予每个任务相同的权重,他们相对于 ridge 的平均优势为 0.0103 $R^2$(95% 任务引导区间,0.0071-0.0136)。我们还评估了 14 种语言模型,总共涵盖 40 项任务,涵盖表型恢复、分类、后续预测和参与者排序。如果没有针对特定群体的拟合,语言模型对某些任务做出了信息丰富的预测,但显示出特定于任务的能力差距、共同的规模失败,并且很少超越在相同输入字段上拟合的特定于任务的岭或逻辑回归模型。 PhenoBench 提供了一个版本化、可审核的评估系统,可以在其中添加新的问题、测量和模型,而无需重新定义现有的比较。