论文

TabFM-Auto:表格基础模型的自演化管道

TabFM-Auto: Self-Evolving Pipelines for Tabular Foundation Models

应用与实践结构化分析、预测与决策

摘要

表格基础模型通过对合成表进行预训练,在结构化数据上实现了强大的零样本精度,但它们忽略了带有数据集语义的列名称、任务描述和辅助文件。与此同时,自我进化的机器学习工程(MLE)Agent在每个数据集上从头开始训练模型,但对特征、架构和超参数的联合搜索充满噪音,并且容易过度拟合。我们引入 TabFM-Auto,它将表格基础模型 TabFM 与围绕其发展数据管道的语言模型Agent配对。在数据集元数据和验证反馈的指导下,TabFM-Auto 迭代地细化数据清理、特征工程、上下文选择和后处理,以减少 TabFM 的错误。在 TabArena 基准测试的所有 51 个数据集中,具有不同Agent和语言模型的 5 个 TabFM-Auto 配置占据了前五名的总体位置,并且最好的将 TabFM 从 1785提升到 2013 Elo。发现的管道也可以转移到其他冻结的表格基础模型(+69 到 +143 Elo),无需进一步搜索。在MLE-Bench的8个排行榜上,TabFM-Auto在MLEAgent中综合排名第一。