论文

KumoRFM-2:扩展关系学习的基础模型

KumoRFM-2: Scaling Foundation Models for Relational Learning

模型训练预训练

摘要

我们介绍 KumoRFM-2,这是关系数据预训练基础模型的下一次迭代。 KumoRFM-2 支持情境学习以及 微调,适用于广泛的预测任务。与表格基础模型相比,KumoRFM-2 本身对关系数据进行操作,同时处理一个或多个连接的表,无需手动表展平或目标变量生成,同时保持时间一致性。 KumoRFM-2 利用大量合成和真实数据的语料库来跨四个轴进行预训练:单个表级别的行和列维度,以及数据库级别的外键和交叉样本维度。与其前身相比,KumoRFM-2 尽早注入任务信息,从而能够更清晰地选择与任务相关的列,并提高对噪声数据的鲁棒性。通过对 41 个具有挑战性的基准进行广泛的实验以及围绕表达性和灵敏度的分析,我们证明 KumoRFM-2 的性能优于监督方法和基础方法高达 8%,同时在冷启动和噪声数据的极端设置下保持强大的性能。据我们所知,这是第一次证明几次基础模型在常见基准任务上超越了监督方法,性能在 微调 的基础上进一步提高。最后,KumoRFM-1 仅限于小规模内存数据集,而 KumoRFM-2 可扩展到十亿规模的关系数据集。