论文

表格基础模型的 JEPA 配方

A JEPA Recipe for Tabular Foundation Models

模型训练预训练

摘要

表格基础模型学习预测上下文中的单元格值,而世界模型自监督则要求在表示空间中进行预测(LeCun,2022;Assran 等人,2023)。在先验的表格基础模型上,联合嵌入预测架构(JEPA)的潜在项在我们早期的运行中崩溃了,并将编码器带到了一个常量映射中。我们报告了一个方法,在该方法下,潜在项在价值目标旁边幸存下来并收敛:价值头读取编码器字段而不是预测器,并且目标是指数移动平均(EMA)差异。为了将其成本限制在只注重价值的手臂上,两只手臂都会进行训练,直到平台规则停止它们为止,没有固定的步骤预算。固定的期限将放缓与上限混为一谈,因为只注重价值的部门仍在改善,远远超出了通常的预算。在收敛时,在每个臂运行一次时,JEPA 臂在 147 个真实数据集上落后于仅值臂,分类上的胜率为 32:70(每个数据集名称一个条目为 29:63),回归上的败率为 8:24,分类上的边际较小,回归上的边际更宽,并且每个层和每个基准中的计数倾斜方式相同。 JEPA 臂 (jepa) 需要 1.42 倍于纯值臂 (ds) 的步数和 1.66 倍的挂钟才能达到稳定状态。