论文

TokEval:分词器评估套件

TokEval: A Tokenizer Evaluation Suite

模型评测评测方法与指标

摘要

尽管语言模型标记器的设计选择直接影响模型功能,但通常会通过最少的评估来选择语言模型标记器。这部分归因于对哪些分词器属性影响下游性能哪些方面的了解有限。我们引入了 TokEval,一个分词器评估指标的框架,它超越了生育率和压缩率等标准衡量标准,以捕获语言和结构上有意义的属性,例如 UTF-8 字符边界完整性和数学中的数字位值边界对齐。为了验证这些指标是否可以预测下游模型性能,我们进行了受控语言模型预训练实验,仅改变分词器的训练数据混合、预分词策略和训练算法。我们根据每字节位数(与分词器无关的困惑版本)和多个基准来评估生成的模型,涵盖语言理解、数学推理和代码生成。我们的实验表明,不同的内在属性对模型能力有不同的影响:信息论指标预测语言建模能力(Spearman rho 高达 0.80),而结构敏感指标(例如测量数字和换行处理的指标)与任务准确性相关。我们希望 TokEval 能够实现更有原则的分词器评估,在两者一致的情况下用内在测量取代预训练扫​​描。