论文

集成表格基础模型 - 多样性上限和校准陷阱

Ensembling Tabular Foundation Models - A Diversity Ceiling And A Calibration Trap

模型评测模型能力评测

摘要

表格基础模型 (TFM) 现在在越来越多的表格任务中匹配或击败了调整梯度增强树,但没有一个 TFM 在每个数据集上都获胜。集成是这里需要解决的问题,但它的效果不如预期。六个现代 TFM 形成一个近乎冗余的池:它们的平均成对 Q 统计量为 0.961 美元,足够接近 1 美元,任何凸组合都在其上方。我们在 153 个 OpenML 分类任务上对 6 个 TFM 的 6 种集成策略进行了基准测试。最好的集成,两级级联堆叠,比最强的单个 TFM 的精度高出 $+0.18\%$,计算成本为 $253\times$。 Friedman 和 Nemenyi 分析将三个系综和最佳基本 TFM 置于单个等价组中;其他三个整体明显比最好的基础更差。与逻辑回归元学习器叠加是最引人注目的案例:竞争准确性和 ROC-AUC(集成中最差的对数损失排名)。元学习器通过锐化类别边界来提高准确性,但这会破坏校准。我们建议将贪婪选择作为实际默认值。