论文

LATTEArena:LLM驱动的表格特征工程评估框架(扩展版)

LATTEArena: An Evaluation Framework for LLM-powered Tabular Feature Engineering (Extended Version)

模型评测基准与评测资源

摘要

特征工程仍然是表格数据分析的基石,大型语言模型 (LLM) 已成为其自动化的一个有前景的范式,从而催生了由 LLM 驱动的自动化表格特征工程 (LATTE)。然而,该领域缺乏标准化、具有成本意识的评估平台,而且设计选择的组合爆炸掩盖了真正的算法进展。为了弥补这些差距,我们系统地将 15 种代表性的 LATTE 方法解构为统一的 6 维分类法。基于这个抽象,我们引入了 LATTEArena,这是一个标准化、模块化和可扩展的基准测试框架,它将整体管道解耦为可重用的执行块。通过提炼巨大的组合空间,我们评估了 7 个研究问题的 24 个核心 LATTE 配置。我们的面对面基准测试超越了预测准确性,量化了词元效率和执行稳健性,得出了 17 项关于成本效益权衡的实证结果。此外,我们还为实际的最佳部署提供了 3 条具体建议。通过实现受控的组件级比较,LATTEArena 将范式从临时提示工程转变为系统的上下文管理。所有代码、数据集和 4,000 多个执行日志均公开可用,以形成动态的、社区驱动的基准。我们的框架、排行榜和所有工件都托管在 LATTEArena 项目网站上:https://goodenhak.github.io/LATTEArena。

LATTEArena:LLM驱动的表格特征工程评估框架(扩展版):论文配图
图 1:LATTEArena 分类和挑战。