论文
经自演化桥接专家知识与自动化特征工程
Bridging Expert Knowledge and Automated Feature Engineering via Self-Evolution
摘要
在品牌合规、临床护理和内容审核等高风险环境中,机器学习不能部署为不透明的预言机:从业者检查驱动模型决策的功能,模型必须利用管理这些领域的专家文档。在实践中,数据以非结构化内容的形式到达,从中提取的特征必须是可解释的、有区别的,并且与专家认为重要的特征保持一致。现有方法存在缺陷:它们以表格输入为目标,缺乏经过证明的专家一致性,并且无法将“保持专业语气”等定性标准转化为精确的特征。我们提出了 FEST(具有自进化树的特征工程),结合双流特征生成(语义和确定性)、语义重复数据删除和树引导的迭代进化,从原始文本和图像中发现可审核的特征。 FEST 在品牌分类、内容真实性检测和压力检测的 20 个分类器任务组合中的 17 个中处于领先地位,与五个分类器的最强基线相比,平均增益为 4.2 个百分点。大语言模型作为评委的评估显示,FEST 在严格的语义对齐阈值下实现了专家设计的品牌特征的 60-80% 覆盖率,人类专家研究在相关性、清晰度和可操作性方面对特征的高度评价证实了这一点。在遵循专家指南后,FEST 将定性标准细化为操作功能,将各个品牌的准确度平均提高了 6-12 个百分点。为了对自动化特征工程中的专家一致性进行系统评估,我们发布了 BrandGuide,这是第一个将专家设计的特征与 2,683 个品牌的 100 万以上资产配对的数据集。通过将特征工程建立在专家知识的基础上,FEST 为需要人工监督的领域中的可解释机器学习开辟了一条实用途径。
