论文
通过训练数据干预探索事实知识转移
Probing Factual Knowledge Transfer with Training Data Interventions
摘要
多语言模型是否在持续的预训练过程中跨语言传递事实知识,或者它们是否主要回忆直接从目标语言数据学到的事实?为了更可靠地回答这个问题,我们提出了一个基于干预的框架:从英语预训练模型开始,我们继续对波斯语数据进行预训练,其中特定事实已在不同粒度级别被系统地删除。我们构建了 SIFT,这是一个包含 20 个关系的 500 个三元组的资源,根据每个事实主题的文化起源分层为一般(全球突出)和波斯语相关实体,旨在从训练数据和评估中系统地删除事实,并使用本地编写的波斯语完形填空模板。我们的结果表明,事实迁移非常有限:在最严格的删除条件下,绝大多数英语获得的事实无法迁移到波斯语。我们进一步表明,句子级共现消除不足以消除事实信号,并且更容易(随机选择)的负面候选集通过奖励浅层联想启发法而大大增加了表观迁移,而允许较少依赖启发法的较难候选集的性能要低得多。最后,我们表明源语言实体频率具有很大的影响,与波斯语相关的事实在英语语料库中罕见几个数量级,很难转移。