论文
TabEmb:表注释的联合语义结构嵌入
TabEmb: Joint Semantic-Structure Embedding for Table Annotation
摘要
表注释对于使 Web 和企业表可用于下游 NLP 应用程序至关重要。与学习语义丰富的标记或句子嵌入通常就足够的文本数据不同,表是列的结构化组合,其中有用的表示必须共同捕获列的语义和列间关系。现有模型通过将 2D 表线性化为 1D 标记序列并使用 BERT 等预训练语言模型 (PLM) 对其进行编码来进行学习。然而,与现代 LLM 相比,这导致语义质量有限,对看不见或罕见值的泛化能力较弱,并且由于 2D 到 1D 扁平化和上下文长度限制而导致结构建模退化。我们提出了 TabEmb,它通过将语义编码与结构建模解耦来直接针对这些限制。 LLM 首先为每列生成语义丰富的嵌入,然后基于列的基于图形的模块将关系注入到嵌入中,从而生成表注释的联合语义结构表示。实验表明,TabEmb 在不同的表注释任务上始终优于强基线。源代码和数据集可在 https://github.com/hoseinzadeehsan/TabEmb 获取