论文

功能化器:子词标记化的无损功能分解

The Functionalizer: Lossless Functional Decomposition for Subword Tokenization

模型训练预训练

摘要

标准子词分词器要么将单词的每个正字法变体(例如 hello、Hello、HELLO 和 Héllo)视为不相关的词汇条目,这会分割嵌入空间,要么通过有损标准化丢弃这种变体。我们提出了Functionalizer,一个无损预分词器框架,在分词之前将拼写和结构变化因素纳入组合操作码/操作数前缀流中:规范的基本标记(操作数),以在 Unicode 专用区域中编码的参数转换运算符(操作码)为前缀。我们引入了涵盖大小写 (CAPITALIZE)、变音符号(13 个专用操作码)和字符重复(REPEAT、MULTIREPEAT)的运算符,这些运算符是完全可逆的。在自然语言和代码语料库中,Functionalizer 在不受限制的耗尽条件下能够以明显更小的词汇量实现完整的语料库覆盖,从而将实际词汇量需求减少高达 19.7%。对 98M 参数 GPT-2 模型的下游评估表明,Functionalizer 提高了 Python 代码语法有效性(9.12% vs. 7.70%),同时减少了自然语言散文中重复的 n-gram 重复。这些发现表明,功能分解可以成为词汇高效、结构感知的语言建模的有效机制,并促进生产规模的进一步验证。