论文

无需训练你的RDB基础模型

No Need to Train Your RDB Foundation Model

上下文与知识上下文工程

摘要

关系数据库 (RDB) 包含大量异构表格信息,可用于预测建模目的。但是,由于企业环境中潜在目标的空间很大,因此每次我们希望预测新的兴趣数量时,我们如何避免重新训练新模型呢?基于上下文学习(ICL)的基础模型提供了一种方便的选择,但到目前为止很大程度上仅限于单表可操作性。推广到多个相互关联的表时,必须将可变大小的 RDB 邻域压缩为固定长度的 ICL 样本以供解码器使用。然而,这里的细节很关键:与现有的监督学习 RDB 管道不同,我们提供的理论和经验证据表明,ICL 特定的压缩应该限制在所有实体共享单元和角色的高维 RDB 列中,而不是在没有标签信息的情况下无法确定异构数据类型的相关性的 textit{across} 列中。在此限制的条件下,我们证明编码器的表达能力实际上并没有因排除可训练参数而受到影响。因此,我们得到了一个原则性的 RDB 编码器系列,它可以与现有的单表 ICL 基础模型无缝配对,无需训练或微调。从实际的角度来看,我们开发了可扩展的 SQL 原语来实现编码器阶段,从而产生了一个易于使用的开源 RDB 基础模型\footnote{\label{foot: RDBLearn_learn} https://github.com/HKUSHXLab/rdbearn},能够在开箱即用的未见过的数据集上提供强大的性能。

无需训练你的RDB基础模型
图8:类 JUICE 嵌入在同质图数据集上的性能反转。每个柱状图基于从 Eremeev et al. (2025b) 中提取的结果,涉及 GraphPFN 以及由 LimiX ICL 解码架构构成的 G2T 模型。