论文

针对 TabPFN 进行预训练文本编码器

Towards Pretraining Text Encoders for TabPFN

模型训练参数高效训练

摘要

表格基础模型(例如 TabPFN)在具有数值和分类数据的表格数据集上实现了强大的性能,但本身并不处理高基数文本特征。因此,标准管道会使用语言模型嵌入文本,并使用 PCA 将生成的向量压缩为少量标量特征,然后再将其输入 TabPFN。这造成了信息瓶颈:大多数嵌入维度被丢弃,并且压缩表示必须由 TabPFN 的特征编码器再次扩展。端到端替代方案可以避免 PCA,但它们需要大量包含文本单元格的预训练数据,并且与在大量合成数据上进行预训练的表格基础模型相比,通常表现不佳。受到 LLaVA(视觉到 LLM 词元投影)和 TableGPT 样式系统(表到 LLM 词元投影)等模态对齐方法的启发,我们引入了 TabPFN 文本适配器(文本到 TFM 词元投影)。我们冻结句子编码器和 TabPFN,只训练一个轻量级适配器,将文本嵌入映射到 TabPFN 嵌入空间中的短标记序列中。这种设计消除了 PCA 瓶颈,保留了 TabPFN 的数值优势,并且比端到端文本表格管道的训练效率更高。