论文
通过凸松弛进行标记化
Tokenisation via Convex Relaxations
摘要
标记化是当前 NLP 流程不可或缺的一部分。当前的标记化算法(例如 BPE 和 Unigram)是贪婪算法——它们做出局部最优决策,而不考虑整个词汇表。相反,我们将分词器构造制定为线性程序,并使用凸优化工具对其进行求解,从而产生了一种我们称为 ConvexTok 的新算法。我们发现 ConvexTok 持续改进了内在标记化指标以及语言模型实现的每字节位数 (BpB);它还可以提高下游任务的性能,但一致性较差。此外,ConvexTok 允许用户通过下限来证明他们的分词器相对于某个目标与最优的距离有多远,并且我们根据经验发现,在常见词汇量大小下,其与最优的误差在 1% 以内。