论文

架构上的数据呈现:使用表格基础模型进行信用风险预测的重采样策略

Data Presentation Over Architecture: Resampling Strategies for Credit Risk Prediction with Tabular Foundation Models

上下文与知识上下文工程

摘要

信用违约预测是一个表格学习问题,具有严重的类别不平衡、异构特征和紧张的延迟预算。表格基础模型 (TFM) 通过上下文学习来解决这个问题,这使得它们的预测对上下文窗口的构建方式敏感。我们在 Home Credit and Lending Club 数据集上对四个经典模型和五个 TFM 进行基准测试,改变上下文构建策略(七个选项)和上下文大小(1K 到 50K)。在这两个数据集上,上下文策略的选择比 TFM 系列的选择解释了 AUC-ROC 的更多差异:平衡和混合采样比均匀采样增加了 3 到 4 个 AUC 点,并且差距超过了 TFM 之间的差距。在 5K 到 10K 示例的平衡背景下,最强的 TFM 达到了在完整数据上训练的经典基线的 AUC,同时还恢复了默认阈值 GBDT 无法做到的有意义的默认类召回。我们将此作为证据,证明上下文构建(而不是架构选择)是不平衡信用风险环境中 TFM 的主要部署杠杆。