论文

词元边界的价格:压缩证书和预测

The Price of Token Boundaries: Compression Certificates and Prediction

模型架构新型架构

摘要

预标记化限制了哪些文本片段可以成为预测单元,但是当仅在相同边界下比较标记器时,其压缩成本就被掩盖了。我们通过限制两侧的最小标记计数来衡量此成本,无论是否有正则表达式边界规则。词元出现的非负价格通过最短路径和词汇预算选择产生下限;最大化所有价格可恢复线性规划松弛,并且独立的整数检查器会验证报告的值。在英文维基百科上,边界将最佳标记数量增加了 28.3--36.8\%。字节对编码比受限制下限高 2.1%,但比无限制下限高 10.9%。压缩和预测有利于不同的字典:在 85M 非嵌入参数和匹配的训练词元预算下,在配对研究中的所有 12 种语言以及独立调整和评估下的 12 种语言中的 11 种语言中,无限制拟合在通用无限制解码器下产生更高的每字节平均保留位数。为了研究中间边界政策,我们引入了边界许可证,它限制了允许交叉的词汇条目并承认相同形式的证书。在单独的英语和中文拟合语料库上,许可 10% 的词汇预算可恢复通过删除所有削减而实现的标记计数减少的 85.2% 和 100.0%。这些结果量化了边界的压缩成本,同时将其与所得词元单元的预测质量分开。