论文
通过提炼基础模型为广义可加模型选择特征交互
Selecting Feature Interactions for Generalized Additive Models by Distilling Foundation Models
摘要
识别有意义的特征交互是为表格数据构建准确且可解释的模型的核心挑战。广义加性模型 (GAM) 在表格数据建模方面取得了巨大成功,但通常依赖启发式程序来选择交互,可能会丢失高阶或上下文相关的效果。为了应对这一挑战,我们提出了 TabDistill,这是一种利用表格基础模型和事后 蒸馏 方法的方法。我们的主要直觉是,表格基础模型通过大规模表示学习隐式学习丰富的自适应特征依赖关系。给定一个数据集,TabDistill 首先将表格基础模型拟合到数据集,然后应用事后交互归因方法从中提取显着特征交互。我们通过将这些交互用作 GAM 中的术语来评估它们。在各个任务中,我们发现 TabDistill 识别的交互可以导致下游 GAM 的预测性能持续改进。我们的结果表明,表格基础模型可以作为交互发现、桥接高容量模型和可解释的附加框架的有效的、数据驱动的指南。