论文

CoFEE:面向基于LLM的特征发现的推理控制

CoFEE: Reasoning Control for LLM-Based Feature Discovery

模型推理推理策略与问题分解

摘要

从复杂非结构化数据中进行特征发现本质上是一个推理问题:它需要识别对目标结果有预测力的抽象,同时避免泄漏、代理变量和结果后信号。随着不断进步的大语言模型(LLM)的出现,我们的方法为应对这一挑战提供了结构化途径。LLM凭借处理海量信息的能力非常适合这一任务,但不受约束的特征生成可能产生弱特征。在这项工作中,我们通过诱导认知行为来研究LLM中的推理控制,以改进特征发现。我们提出CoFEE(Cognitive Feature Engineering Engine),一个在特征发现过程中强制LLM认知行为的推理控制框架。从机器学习视角看,这些认知行为充当了模型生成候选特征空间上的结构化归纳偏置。这些行为已在机器学习模型中被成功利用,包括从结果反向推理(backward chaining)、子目标分解、对照可观测性与泄漏准则进行验证,以及对被否决推理路径的显式回溯。在一项受控比较中,我们表明强制认知行为所产生的特征比不受约束的vanilla LLM提示下的特征具有更高的经验可预测性。CoFEE的平均Success Rate Score比vanilla方法高15.2%,同时生成的特征减少29%,成本降低53.3%。借助留出特征评估,我们考察认知诱导的特征能否泛化到发现阶段所用数据之外。结果表明,在我们评估的设定中,推理控制与基于LLM的特征发现在质量与效率上的提升相关联。

CoFEE:面向基于LLM的特征发现的推理控制:论文配图
图1:CoFEE流水线概览:通过推理控制机制辅助基于LLM的内部特征发现与分析。