论文

大语言模型作为文本和表格预测的特征工程师

LLMs as Feature Engineers for Text-and-Tabular Prediction

智能体系统Agent 架构与控制循环

摘要

我们引入了一个迭代框架,可以自动从表格预测模型的非结构化文本中提取可解释的、模式绑定的分类特征。为了导航特征空间,生成器 LLM 提出语义定义,单独的提取器 LLM 实现特征,下游表格模型评估其预测性能。我们通过将显式模型错误(例如 AUC 排名倒置)转换为自然语言反馈来优化此搜索,引导大语言模型解决特定的预测失败问题。通过对三个公共数据集进行评估,与无引导的搜索相比,这种错误驱动的循环可将特征发现速度提高高达 3 倍。根据经验,生成的特征表现出强大的多视图互补性,与 TF-IDF 和密集嵌入结合时,其性能严格优于任何子集。最后,该框架保证实例级可解释性:发现的特征主导 SHAP 重要性排名,并为每个预测提供完全透明的语义审计跟踪。