论文

CDMD:表格数据的跨数据集混合类型扩散模型

CDMD: A Cross-Dataset Mixed-Type Diffusion Model for Tabular Data

模型训练预训练

摘要

表格数据的生成模型通常针对每个数据集单独训练,限制了知识转移并需要存储许多专用模型。在本文中,我们介绍了 CDMD,这是一种在具有不同模式以及可变数量的数值和分类特征的异构数据集上联合训练的表格扩散模型。与在连续表示空间中运行的现有跨数据集表格扩散模型不同,CDMD 直接在混合类型特征空间上定义扩散,并进行端到端训练。为了适应异构分类域,我们为掩码扩散模型引入了模式限制的逆向过程参数化,其中输出空间动态适应每个特征的词汇表。然后,我们将数值和分类特征级扩散过程组合成依赖于模式的行级过程。共享模式感知的 Transformer 降噪器捕获功能之间的依赖关系,并参数化不同模式之间的反向过程。在七个真实数据集上,单个联合训练的 CDMD 在强大的单数据集和跨数据集基线中实现了最高的平均生成质量,同时使用的总参数比单独训练的模型集合少得多。此外,对 337 个数据集的语料库进行预训练可以提高在有限的目标数据和有限的适应时期下以前未见过的数据集的生成速度。这些结果证明了直接混合型扩散在共享和可转移表格数据生成方面的潜力。我们的代码可在 https://github.com/ketatam/cdmd. 获取