论文
通过上下文感知语义嵌入增强表格学习模型
Enhancing Tabular Learners with Context-Aware Semantic Embeddings
摘要
在现代表格学习器中,它们擅长捕捉统计模式,但经常处于语义真空状态,将文本特征视为离散符号,并忽略特征名或单元格中的丰富语义。我们提出CASE(Context-Aware Semantic Embeddings),这是一种新型框架,旨在弥合大语言模型(LLMs)的语义理解和表格学习器(tabular learners)的统计能力之间的差距。与现有方法不同,CASE利用了上下文化策略:我们预填充定制训练的Gemma 3基于表格语言模型的KV缓存,以代表性的样本行来建立数据集语义的持久锚点。这确保生成的行嵌入是动态上下文化的,解决了语义歧义问题,并在领域特定上下文中锚定表示。我们在几个基准测试(CARTE、TextTab和TabArena)上的实验结果表明,CASE显著提高了表格学习器在具有丰富语义的数据集上的性能,在低数据资源情况下尤为明显。
