论文

长文本到预测特征:通过可执行程序搜索进行LLM指导的块式特征工程

Long Text to Predictive Features: LLM-Guided Blockwise Feature Engineering via Executable Program Search

智能体系统应用与实践Agent 规划编程行业应用

摘要

工业风险控制系统通常依赖结构化数据模型进行有效预测,但大量有价值的信息仍然嵌入在非结构化长文本中。通过手动特征工程提取这些信息是劳动稠密型的,同时需要大型语言模型(LLM)来处理每个实时输入可能无法满足实际部署要求。为了应对这一挑战,我们提出了LLM-BlockFE,这是一种LLM引导的离线特征构建框架,可将长文本转换为可执行特征程序,从而避免在线推理期间的LLM调用。 LLM-BlockFE 通过增量附加不可变代码块来构造特征程序,并使用下游模型评估候选特征。为了解决传统贪婪搜索陷入次优解决方案的趋势,我们的方法引入了基于深度校准信用分配的块级回滚机制,并以交错的方式推进多个独立的搜索轨迹,通过共享每个的固定描述来减少冗余探索 轨迹的探索方向。搜索后,生成的程序被冻结并部署以提取下游预测模型的结构化特征。在两个公共数据集和两个私有数据集上,LLM-BlockFE 的绝对 AUC 比全数据集比较中每个数据集的最强基线提高了 0.0069 至 0.0358。对五个已部署的金融风险控制应用程序的启动后监控显示,与现有手动设计的策略相比,绝对 KS 提高了 0.02 至 1.56 个百分点。