论文

表格基础模型能够学习关联规则

Tabular Foundation Models Can Learn Association Rules

模型推理推理策略与问题分解

摘要

关联规则挖掘(ARM)是表格数据知识发现的基础任务,广泛用于高风险决策。经典 ARM 方法依赖频繁项集挖掘,导致规则爆炸和可扩展性差;近期神经方法缓解了这些问题,但在低数据量场景下性能下降。在多样表格数据上预训练、具备强大上下文泛化能力的表格基础模型(TFM)为解决这些局限提供了基础。我们提出一个模型无关的关联规则学习框架,可从表格数据上的任意条件概率模型中提取关联规则,从而利用 TFM。随后我们提出 TabProbe,该框架的一个实例,将 TFM 用作条件概率估计器,开箱即用地学习关联规则,无需频繁项集挖掘。我们基于标准 ARM 规则质量指标和下游分类性能,在不同规模的表格数据集上评估该方法。结果表明,TFM 持续产出简洁、高质量、预测性能强的关联规则,且在低数据场景下无需任务特定训练依然稳健。源代码见 https://github.com/DiTEC-project/tabprobe。

表格基础模型能够学习关联规则
图4:在小规模表格数据上使用CORELS的分类任务结果。TFM在5个小数据集中的4个上取得更优或相当(±1%)的预测性能,Cervical Cancer数据集除外。这表明TFM学到的少量规则在未见数据上确实比基线更具可泛化性。