论文
学习语言
Learning to Learn a Language
摘要
我们提出了先验拟合语言模型 (PFLM),这是一个 300M-参数字节级转换器,仅对来自合成非语言先验的样本进行预训练。给定真实文本的前缀,它学会在从未见过任何真实语言的单词的情况下,用冻结的权重来预测上下文中的语言。每个训练序列都是由从此类模型的分布中新鲜提取的循环结构因果模型生成的。该模型在训练期间不会两次看到相同的语言,因此预测延续的唯一方法是从前缀推断语言。先前的样本共享自然文本的统计特征:Zipfian 频率、缓慢的熵率收敛和长程依赖性。在六种语言的维基百科上,在一百万字节的上下文中,每字节的位数从统一的 8 下降到 0.9 到 2.4 之间。给定数字而不是文本,PFLM 学会计数、比较大小以及近似相加。它可以预测 Rudin-Shapiro 或素数指示器等确定性序列,并压缩六个非文本域,从源代码到语音,低于 gzip 和 PPMd。该模型尚未学习语言。它已经学会了学习一个。
