论文
TabuLM:适用于低资源语言的形态感知表格 预训练
TabuLM: Morphology-Aware Tabular Pre-training for Low-Resource Languages
摘要
我们推出 TabuLM,这是第一个在基尼亚卢旺达语表格数据上预训练的语言模型。基尼亚卢旺达语是一种形态丰富的班图语,卢旺达有超过 1200 万人使用,但缺乏任何专门的表格表示学习资源。 TabuLM 扩展了 KinyaBERT-large(一种两层形态学 Transformer),具有附加的行、列和单元类型嵌入以及学习的表结构注意力偏差,可增强同一行和同一列的注意力。 预训练 使用两个新目标:屏蔽单元恢复 (MCR),它屏蔽整个单元并强制根据行和列上下文进行重建;列类型预测 (CTP),它根据观察到的单元值预测列语义类型。我们对来自 NISR、RAB、REB 和 MoH 开放数据门户的 172 个卢旺达政府表格(约 35,000 个单元格)进行预训练,并引入 TabQA-kin,这是第一个本地卢旺达语表格问答基准,包含 31 个表格和四种问题类型的 526 个 QA 对。 TabuLM 在 TabQA-kin 上实现了 62.0% 的精确匹配,比 KinyaBERT-large 高 5.7 EM 点,比所有多语言基线(mBERT 49.3%,XLM-R 50.0%)高 11.7-12.7 点。分析表明,结构表嵌入对于比较和查找问题最具决定性,而形态意识则提供了补充收益。我们的代码、数据和预先训练的检查点都是公开的。