论文

当分词器失​​败时:字节级分块以零次传输到低资源语言

When Tokenizers Fail: Byte-Level Chunking for Zero-Shot Transfer to Low-Resource Languages

模型训练监督微调与指令调优

摘要

子词标记化通过将主导语言的频率模式强加到脚本共享变体上来阻碍低资源语言处理。字节级模型通过处理原始 UTF-8 字符来绕过此问题,但它们会为非拉丁脚本中的字级任务造成粒度不匹配。分层字节级架构通过将字节分组为字对齐的块来解决这种不匹配问题。然而,这些架构需要大量的训练数据,并且在与基于冻结子词的语言模型配合使用时会出现表征错位。在本文中,我们提出了一种适应性的分层网络框架,无需进行大量训练即可弥补这种模态差距。我们的方法直接从冻结基本模型的子字表示初始化字节嵌入。我们应用块对齐损失来将动态分组的字节块投影到预先计算的子字目标,并交错轻量级词性(POS)监督来指导边界检测。跨六种语言的实验表明,我们的无分词器方法提高了单词级形态任务的性能,使词性标注提高了 13.3%。