论文

使用 LLM 符号化决策过程实现的可解释列注释

Interpretable Column Annotation with LLM-Symbolized Decision Process Materialization

应用与实践结构化分析、预测与决策

摘要

列注释(CA)包括列类型注释(CTA)和列属性注释(CPA),旨在识别表列的含义以及它们之间的语义关系。最近的CA方法通常使用各种神经模型来学习列表示并将其直接映射到标签类别,从而(1)牺牲模型的可解释性和适应性,以及(2)忽略丰富的标签语义并最终限制准确性。为了解决这些限制,我们提出了 SymCA,这是一个 LLM 授权的可解释 CA 框架,它将列注释具体化为全局到局部的符号决策过程。 SymCA 由两个组件组成:(1) 全局骨架归纳,在标签空间上构建语义骨架;(2) 局部底物演化,在骨架内演化预测底物。具体来说,为了利用标签语义,同时保留可解释的决策过程,全局骨架归纳模块利用 LLM 生成候选上位词启发的树结构语义骨架,并采用基于最小贝叶斯风险 (MBR) 的共识策略来选择针对生成方差的鲁棒骨架。由于不同的内部节点需要不同的证据来区分其子节点,因此局部基底演化模块将每个内部节点具体化为可执行且可演化的预测基底。在多个进化轮中,每个基质使用当前算子集训练可解释的随机森林分类器,利用 LLM 提出特定于节点的算子修改,并使用探索-利用策略来优先考虑有前途的基质。大量实验表明,SymCA 准确、稳健且可解释,在 Micro-F1 中平均优于最强基线 6.42%,在 Macro-F1 中优于最强基线 11.03%。