通用字节级编码:UTF-8/UTF-16 路由以减少跨脚本词元预算差异
Universal Byte-Level Encoding: UTF-8/UTF-16 Routing to Reduce Cross-Script Token-Budget Disparities
摘要
字节级字节对编码 (BBPE) 分词器对于多语言大语言模型 (LLM) 很有吸引力,因为它们涵盖了所有 Unicode 文本。然而,在基于 UTF-8 的 BBPE 中,许多脚本的回退成本高于英语:当无法应用学习的合并时,多字节字符需要多个字节派生符号。我们将这种最坏情况的预合并成本称为编码层。较高的楼层可以增加词元数量和每个请求的成本并缩小可用上下文。更改文本编码可以缩小这种差距,但单一全局编码可能会使混合脚本文本中已经高效的英语跨度变得更加昂贵。我们提出了通用字节级编码(UBE),这是一种双字母分词器,它在 UTF-8 路径上保留 1-2 字节 UTF-8 字符,同时通过 UTF-16 路由 3-4 字节 UTF-8 字符。这降低了具有高词元溢价(相对于英语的词元计数)的脚本中 3 字节基本多语言平面 (BMP) 字符的编码下限,而不会提高混合脚本文本中已经高效的跨度。 UBE 仅更改呈现给字节对编码 (BPE) 的字节表示形式;合并规则仍然是标准的,并且保留了精确的解码。 UBE 还包含替代边界策略和基于形态的表示。在 Unicode 17 审核中,UBE 精确地往返官方规范化、字形中断和表情符号测试套件中的所有 Unicode 标量值和所有输入。在内在评估中,UBE 降低了英语标准化词元计数比率的分散性,从而减少了跨语言词元预算差异。在多语言语言模型 (LM) 实验中,UBE 与 BBPE 的 LM 质量相匹配。在主要的多语言设置中,UBE 最大程度地减少了高保费脚本的词元计数,并略微降低了英语词元计数,从而在固定词元预算下产生更多可用的上下文,并在内容匹配的基准中更快地进行提示处理。