论文
因果评估正式语言任务的可学习性
Causally Evaluating the Learnability of Formal Language Tasks
摘要
语言模型作为多任务学习器,在训练过程中获得广泛的能力。一个基本问题是需要多少特定于任务的数据来学习给定的任务。对于自然语言来说回答这个问题是很困难的:任务很难描述并且可能会相互混淆。为了严格研究数据频率和可学习性之间的关系,我们转向使用从概率有限自动机导出的形式语言的受控设置。这些作为方法论测试平台,证明标准相关评估实践存在固有缺陷。为了进行因果分析,我们引入了分箱半环,这是一种代数对象,可以让我们控制目标属性在采样语料库中出现的频率。我们将实验流程制定为因果图形模型,并导出分解的 Kullback-Leibler 散度度量来衡量特定子任务的可学习性。我们的实验表明,在没有因果干预的情况下评估可学习性会因相关分析中的混杂因素而导致错误的结论,并作为对自然语言环境中相关陷阱的警告。