论文
课程很重要:使用合成数据进行数据高效的关系 PFN 预训练
Curriculum Matters: Data-Efficient Relational PFN Pretraining with Synthetic Data
摘要
关系先验数据拟合网络 (PFN)(例如 RDB-PFN)通过对数百万个合成任务进行预训练,对多表关系数据库进行近似贝叶斯推理。我们研究了有关该范式的三个相互交织的问题。首先,结构上不同的合成生成器 PluRel 能否替代 RDB-PFN 的先验?其次,向 PFN 提供合成数据的顺序对下游性能有多大影响?第三,在引入任何关系数据之前,PFN 仅通过单表综合预训练可以获得多少关系推理?使用 PluRel 作为所有实验中唯一的合成数据源,我们发现:(i)渐进式单表课程逐渐将模式复杂性从 7 列扩大到 17 列,仅使用大约 13,300 个合成表(比 RDB-PFN 报告的热身配方少大约 45 倍的单表数据集),在 23 任务表格基准上达到 0.703 平均 ROC-AUC,而训练的相同数据ROC-AUC 一下子崩溃到 0.541; (ii) 仅在约 5,500 个 PluRel 数据库上从头开始训练的关系课程在 19 任务 RelBench/4DBInfer 基准上达到 0.638 平均 ROC-AUC,恢复了 RDB-PFN 报告性能的 88%,而关系合成数据减少了约 220 倍; (iii) 单表课程模型直接在关系基准上评估而没有任何关系适应,达到 0.631,几乎与专用关系管道匹配。总之,这些发现表明,课程设计和合成数据多样性对于关系 PFN 预训练可能比单独的特定关系生成器或原始合成量表更重要。