论文
结构化数据的进化特征工程
Evolutionary Feature Engineering for Structured Data
摘要
大语言模型 在进化优化中越来越多地用作开放式搜索算子。我们引入了进化特征工程(EFE),这是一个使用基于 LLM 的进化来发现结构化数据的预处理转换的框架。 EFE 将转换表示为具有标准化拟合/转换接口的 Python 程序,允许它们直接插入到现有的机器学习管道中。在演化过程中,候选程序使用数据集上下文、摘要统计数据和验证集的下游性能反馈进行细化。我们在两种设置中实例化 EFE。对于时间序列预测,EFE-Time 学习可逆的、特定于数据集的标准化,从而改进现成的时间序列基础模型。当跨数据集平均时,它可以将预测错误(MASE、WQL、MAE)减少 3% 或更多,并且在 COVID-Deaths 数据集上的改进高达 19%。值得注意的是,这些改进出现在最近的 TSFM(例如 Chronos-2)中。对于表格预测,EFE-Tab 开发了紧凑的特征程序,添加有用的可解释特征并删除冗余特征,从而改进或匹配现有的基于 LLM 的特征工程方法。我们发现 EFE-Tab 对于经典决策树特别有效,在经典决策树中,一小组进化的特征可以在保持可解释性的同时产生有竞争力的准确性。总体而言,EFE 证明,在自动处理结构化数据时,基于 LLM 的进化可以提高准确性和可解释性。