论文
演化 LLM 生成特征以实现可解释分类
Evolving LLM-Generated Features for Interpretable Classification
摘要
大语言模型 (LLM) 越来越多地用作分类器,但它们作为不透明系统运行,其决策难以解释,这使得它们在信用评分或医疗诊断等受监管领域的使用变得复杂。我们提出了一个进化框架,它迭代地发现自然语言特征定义(标题)以进行可解释的分类。 LLM 生成候选二进制特征,根据它们评估每个样本,所得向量可用于训练透明分类器,例如逻辑回归。特征集在分类错误、每类激活率和特征 消融 分数的指导下经过多次迭代而演变。我们评估了三个基准,包括代表受监管领域的信用风险数据集、比较单次 LLM 评分标准、进化评分标准和直接零样本 LLM 分类。进化后的特征比单次评估标准平均提高了 2.9 个百分点,并且在三项任务中的两项上优于零样本 LLM 分类,同时提供完全可审核的决策逻辑。在信用风险任务上,零样本 LLM 执行 处于随机水平 (50.7%),并对单一类别有强烈偏见,而进化的特征实现了平衡、可解释的预测。至关重要的是,这种失败在总体准确性中是不可见的,并且仅在每类审核下才会显现出来。分析表明,当标签边界无法单独从类别名称推断或 LLM 缺乏可靠的特定领域推理时,进化是最有效的。
