论文
表格基础模型的训练数据归因检验床
From Behavior to Provenance: Attributing Tabular Foundation Models to Synthetic Pretraining Data
摘要
训练数据归因旨在识别哪些训练样本塑造了模型行为,但因因果训练影响难以观测,验证这类主张很困难。我们论证:受控合成预训练使归因可实验检验。利用表格基础模型的谱系丰富合成任务生成器O PRIOR,我们构建检验床:每个预训练任务在结构机制、缺失、混淆、捷径与分布偏移上携带显式谱系。我们结合行为条件归因、反事实重训与谱系感知干预,检验任务级忠实性与机制级一致性。在留出真实任务上,移除归因最高的5%合成任务使平均ROC-AUC下降0.013(随机移除仅0.002±0.004),移除归因最低的任务反而提升0.003;在捷径谱系任务内,定向移除效应0.043对匹配随机移除的0.016。谱系判别的排序AUROC较温和(0.55-0.62),尽管top-k富集显著,说明谱系关联与干预忠实性不必重合。这些结果确立合成谱系作为可验证的贡献性归因受控设定。