论文
SymboLLM-FE:LLM-表格数据自动特征工程的加速符号回归
SymboLLM-FE: LLM-Accelerated Symbolic Regression for Automated Feature Engineering on Tabular Data
摘要
表格数据作为机器学习的核心数据格式,由于特征信息量不足,往往缺乏高性能建模所需的判别力。自动化特征工程 (AutoFE) 通过自动化特征生成和选择来克服这一问题,确保模型性能和运行效率。然而,传统的 AutoFE 通常会产生可解释性较差的特征,因为它们依赖于盲目的数学转换,而基于 大语言模型 (LLM) 的 AutoFE 面临着需要昂贵的多轮迭代来生成高实用性特征以有效增强模型性能的挑战,而固有的偏差和幻觉风险又加剧了这种挑战。在本文中,我们将符号回归与 LLM 相结合进行特征工程(SymboLLM-FE)来解决这些挑战。我们通过符号回归提取与目标强相关的数学表达公式,这可以增强模型性能,然后通过具有丰富先验知识的 LLM 对其进行细化以确保可解释性。六个真实数据集和四场 Kaggle 竞赛的实证结果表明,SymboLLM-FE 优于现有的 AutoFE。 SymboLLM-FE 还通过采用基于统计的先验 LLM 细化机制和单位数 LLM 调用来解决可解释性差和多次迭代的双重挑战。