论文
WWHO:先分离文字结构,再进行词元压缩
Separate Before You Compress: The WWHO Tokenization Architecture
摘要
BPE分词器适合英语等拉丁文字,但可能把复杂元音附标文字中由多个码点组成的连字拆成无意义的子字符,提高推理成本。WWHO(Where-What-How Often)采用三层架构,配合音节感知字素对编码SGPE,将文字规则与统计压缩分离,同时支持多语言分词。研究在清洗后的3,000万句僧伽罗语与天城文数据上训练,在1,499,950句测试集上评估。僧伽罗语的词元与词数比为1.274,每词元4.83个字符,相对o200k base减少61.7%的词元;印地语的比值为1.181,词元减少27.0%。混合僧伽罗语、天城文与英语时,总体比值为1.240,相对o200k base、Llama 4 Scout和DeepSeek V3分别减少36.7%、39.6%和60.2%。原文报告这些语言的可用上下文最多扩展4.38倍,并保证有效音节不被切分到多个词元。