论文

无参数编码器对于 RDB 基础模型仍然可行

Parameter-Free Encoders Remain Viable for RDB Foundation Models

模型评测模型行为与机制分析

摘要

给定存储异构表格信息的关系数据库(RDB),我们如何预测某些感兴趣的目标列中缺失(或未来)的值?由于整个企业环境中潜在目标的空间很大,因此最好避免每次出现新的预测任务时从头开始学习新模型。基于 RDB 特定编码器的冻结基础模型提供了可行的解决方案,但理想的设计仍然是一个悬而未决的问题。一方面,最近有人认为某些无参数子图编码器与单表基础模型相结合可以实现接近 SOTA 的性能,而不需要特定于 RDB 的 预训练。与此同时,其他当代研究主张对参数化编码器进行预训练,以利用可观察的标签来学习特定于任务的表示。为了解决这种歧义,我们专门分析了当标签作为输入时的 RDB 编码器属性,证明了可训练编码器参数的潜在功效的局限性。作为经验验证,我们证明了相当简单的无参数编码器仍然能够在许多相关的基准测试任务中表现出强大的性能。