论文
深表格生成器在多大训练规模以下不再胜过平凡基线?
Below what training size do deep tabular generators stop beating trivial baselines? A preregistered benchmark on a size ladder of clinical and standard datasets
摘要
深表格生成模型在数万行的数据集上被评测;临床数据集只有数百行。我们预注册并运行尺寸阶梯基准以找到两种状态分歧之处:8个公开数据集从200到20000训练行子采样,七个生成器(独立边际、高斯copula、SMOTE、无条件SMOTE、CTGAN、TVAE、TabDDPM)配固定20次尝试调参预算与5个评估种子,另加4个真实尺寸的原生小型临床数据集,共2220次提交运行。主要指标为在合成数据上训练、真实数据上测试的固定分类器的AUROC。在24个(数据集,深模型)对中的23个,任何受测训练规模下都没有深模型以超过种子噪声的优势击败最佳平凡基线;最佳基线赢下49个(数据集,规模)格中的40个。我们预注册的预测——深模型排名在小尺寸下不稳定——被证伪:5000行以下相邻档的平均Kendall tau为0.806(高于我们0.8的阈值),且稳定性在最小尺寸最高而非最低。一个限定一切的警告:81%的格中前两名方法的差距小于种子间变异。最后,原生小临床数据集上的方法排名与子采样大者仅中等一致(平均tau 0.57-0.64),质疑子采样大数据能否替代小数据。全部2220个结果文件、预注册及其哈希、以及从这些文件再生每个图表与数字的代码均已公开。