论文
Pocket Foundation 模型:将 TFM 提炼为 CPU 就绪的梯度提升树
Pocket Foundation Models: Distilling TFMs into CPU-Ready Gradient-Boosted Trees
摘要
欺诈记分员需要在 2 毫秒内做出回答。最好的表格基础模型 (TFM) 在 GPU 上需要 151-1,275 毫秒。我们通过将 TFM 离线提炼为在 CPU 上本地运行的 XGBoost 或 CatBoost 学生来缩小这一差距。主要障碍是情境学习(ICL)教师所特有的:他们在对自己的训练集进行评分时泄漏了标签,因此软目标崩溃为接近单热向量,没有可供提取的类间结构。分层折叠(OOF)教师标签可以防止这种情况发生。在从 TALENT、OpenML-CC18、TabZilla 和 TabArena 中提取的 153 个分类数据集中,将 TabICLv2 提取到 XGBoost 中,在 CPU 上运行 1.9 毫秒时,宏观平均 AUC 为 0.882(教师 AUC 的 96.5%),师生对的速度提高了 38 倍到 860 倍,与调整后的 CatBoost 基线相比具有统计学上的显着优势 (Wilcoxon p = 0.0008;51% 胜率)。进一步的四个发现:教师等级准确地转移到学生等级;增益集中在低维数据上(< 21 个特征:+0.011 超过 CatBoost vs. >21 个特征:+0.001);多教师平均对 MLP 学生有帮助(+0.006,p = 0.003),但对树学生来说增加不到 0.001;在教师本身落后于 CatBoost 的高维任务中,蒸馏 会使事情变得更糟而不是更好。完整的管道作为 TabTune 库的一部分开源。