论文
TabEmbed:用于表格理解的基准测试和学习通用嵌入
TabEmbed: Benchmarking and Learning Generalist Embeddings for Tabular Understanding
摘要
基础模型已经为自然语言处理建立了统一的表示,但这种范式在很大程度上仍未针对表格数据进行探索。现有方法面临根本局限性:基于 LLM 的方法缺乏与检索兼容的向量输出,而文本嵌入模型通常无法捕获表格结构和数字语义。为了弥补这一差距,我们首先引入表格嵌入基准(TabBench),这是一个旨在评估嵌入模型的表格理解能力的综合套件。然后,我们提出 TabEmbed,这是第一个在共享嵌入空间内统一表格分类和检索的通用嵌入模型。通过将各种表格任务重新表述为语义匹配问题,TabEmbed 利用大规模对比学习和积极感知的硬消极挖掘来辨别细粒度的结构和数字细微差别。 TabBench 上的实验结果表明,TabEmbed 显着优于最先进的文本嵌入模型,为通用表格表示学习建立了新的基线。代码和数据集可在 https://github.com/qiangminjie27/TabEmbed 和 https://huggingface.co/datasets/qiangminjie27/TabBench 上公开获取。