论文
数据高效语言学习的结构先验
Structural priors for data-efficient language learning
摘要
高效的语言学习需要减少对大数据和计算资源依赖的方法。我们研究结构迁移:首先对非语言数据进行训练模型,以诱导自然语言的有用先验。这种方法是多语言建模的权重初始化的一种形式。我们通过下一个词元预测损失、模型中的权重变化和下游语言基准来评估传输。几种符号数据类型——尤其是音乐、概率语法和细胞自动机——比随机初始化产生更低的语言建模损失。这些增益与后续语言训练期间较小的权重变化相一致,表明结构转移将模型置于参数空间的更有利区域。然而,较低的损失并不能始终如一地转化为更好的下游语言性能,并且非语言数据的传输效率低于其他语言数据。我们的结论是,非语言数据可以部分替代语言数据,以实现下一个标记预测的训练目标,但不能可靠地支持更广泛的语言泛化。