论文
表格基础模型的模型感知数据清理
Model-Aware Data Cleaning for Tabular Foundation Models
摘要
表格基础模型 (TFM) 在小型表格数据集上实现了最先进的零样本精度,但它们的上下文学习假设近似干净的输入:现实世界中的缺失值、异常值和重复项会产生先验不匹配,从而降低精度和校准。我们研究用于表格数据清理的强化学习,这是一种对清理操作符进行排序的学习策略,并引入具有模型感知奖励(TFMAwareReward)的 L2C-TFM。我们明确了这个奖励优化的内容:它规范了清理后的数据和原始(脏)数据之间的 Wasserstein 距离,这是一个分布稳定性项,我们将其作为诊断来衡量。在十个 OpenML 数据集上进行的六次实验中:(i) 七个奖励设计中的三个崩溃为退化策略,因此奖励工程并非易事; (ii) 在 8 种子重复保留协议下,模型感知奖励在准确性上与随机森林奖励基线相匹配 (p=0.38),其收益仅限于类别不平衡下的少数类别宏观 F1,部分是与奖励无关的校准阈值效应; (iii) 在一个数据集上预先训练的策略转移到保留的数据集。诊断分析表明,这两个距离是不同的目标:清理往往会将数据移离先前的距离,而跟踪下游质量的是先前的距离,而不是到脏的距离。因此,我们将先前的一致性视为激励目标和未来工作的目标,而不是此处评估的奖励的属性。代码、数据集和嵌套评估工具可从 https://github.com/LaureBerti/Learn2Clean/tree/master/Learn2Clean_TFM 获取。