论文

通过上下文感知语义嵌入增强表格学习模型

Enhancing Tabular Learners with Context-Aware Semantic Embeddings

上下文与知识上下文工程

摘要

在现代表格学习器中,它们擅长捕捉统计模式,但经常处于语义真空状态,将文本特征视为离散符号,并忽略特征名或单元格中的丰富语义。我们提出CASE(Context-Aware Semantic Embeddings),这是一种新型框架,旨在弥合大语言模型(LLMs)的语义理解和表格学习器(tabular learners)的统计能力之间的差距。与现有方法不同,CASE利用了上下文化策略:我们预填充定制训练的Gemma 3基于表格语言模型的KV缓存,以代表性的样本行来建立数据集语义的持久锚点。这确保生成的行嵌入是动态上下文化的,解决了语义歧义问题,并在领域特定上下文中锚定表示。我们在几个基准测试(CARTE、TextTab和TabArena)上的实验结果表明,CASE显著提高了表格学习器在具有丰富语义的数据集上的性能,在低数据资源情况下尤为明显。

通过上下文感知语义嵌入增强表格学习模型:论文配图
图 2:我们提出的表格语言模型 (TLM) 架构的图示,其中包含训练期间的表序列化和目标插补目标。