论文
GEEB:为什么基因组模型难以比较
GENEB: Why Genomic Models Are Hard to Compare
摘要
由于基准分散、评估协议不兼容和特定于任务的报告,基因组基础模型的进展很难评估。因此,跨模型的优越性或通用性主张通常无法直接比较。我们引入了 GEEB,这是一个大规模诊断基准,可在统一的基于探测的协议(包括少样本方案)下评估跨 13 个功能类别的 100 个任务中 40 个基因组基础模型的冻结表示。 GEEB 可以在模型规模、架构、标记化和预训练数据之间进行受控比较,同时明确暴露任务级别的权衡。我们的分析表明,总体排行榜不稳定:不同任务类别的模型排名差异很大,规模仅提供适度且不一致的收益,架构和预训练的一致性经常超过参数数量。这些结果凸显了当前评估实践的局限性,并将 GEEB 定位为基因组机器学习中原则性比较和类别感知模型选择的参考框架。