论文

SIGMA:SHAP 引导隐式轨迹生成,用于基于 LLM 的无元数据 AutoFE

SIGMA: SHAP-Guided Implicit-Trajectory Generation for Metadata-Free LLM-Based AutoFE

上下文与知识上下文工程

摘要

最近的研究利用 大语言模型 (LLM) 通过语义描述和基于轨迹的提示来增强自动化特征工程 (AutoFE)。然而,存在两个限制其在长范围优化中的适用性和可扩展性的挑战:(1)语义元数据在许多实际设置中不可用,(2)轨迹积累增加了超出上下文窗口的风险,而没有它,生成过程可能会变得不稳定,导致陷入局部最优和生成的特征的高重复率。为此,我们提出了一种 SHAP 增强的无元数据 AutoFE 隐式轨迹生成(SIGMA),这是一种可扩展的恒定上下文优化框架。 SIGMA 利用 SHAP 值提供任务感知信号来指导组特征生成,而不是语义信息。此外,我们采用暴露特征隐式轨迹(EXIT)方法,其中提示中暴露的特征隐式表示轨迹。经验结果表明,SIGMA 的性能可与最先进的 (SOTA) LLM 基线相媲美,且提示长度几乎恒定。值得注意的是,EXIT 将生成特征的重复率从 37.2% 显着降低到 6.8%。同时,SIGMA 平均只有 5.4 个特征,与传统的 SOTA 性能相当,显示出特征利用方面的显着效率提升。