论文
无需训练的合成:表格、时间和关系合成数据的仅推理管道
Synthesis Without Training: An Inference-Only Pipeline for Tabular, Temporal, and Relational Synthetic Data
摘要
合成数据生成以先拟合后采样范式为主:在私有数据集上训练生成模型,然后从中采样。尽管它被广泛采用,但这种范式面临三个挑战:(1)每个数据集都需要运行新的训练; (2)不同的数据模式,例如单表、时间序列和关系数据库,需要针对特定任务的模型和特征工程; (3) 生成的模型是不透明的,使其在数据约束下的行为难以检查。我们提出了 GENSCRIPT,这是一种消除模型训练的纯推理管道。 GENSCRIPT 计算源数据的确定性统计概况(列类型、范围、缺失、类别、相关性等),并将其(而不是原始行)传递到语言模型以推断字段语义和跨列完整性约束。然后,编码Agent将配置文件和约束编译成可执行的、可审计的采样器。这种统一的方法支持单表、时态和关系数据,无需特定于任务的建模。在四个单表基准测试中,GENSCRIPT 在 2 分钟内构建生成器,并在 6 秒内对 50k 行进行采样,同时在边际保真度方面与领先方法保持在几个点之内。值得注意的是,它是唯一能够完美保留 Adult 数据集中列之间的 1 对 1 映射的方法。在智能建筑数据集上,它生成比两个基线更接近真实分布的条件时间序列,并完美地保留相应关系数据库中的主键和外键关系。