论文
语言编码的速率效用前沿:比较受控语言内容下的标记、字节和像素
Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content
摘要
语言模型将文本编码为子字标记、原始字节或渲染像素,但这些编码通常在建模约束下进行比较,这些约束将不同数量的语言内容暴露给不同语言的模型。相反,我们会问当内容和下游容量都受到控制时,每种编码会保留什么。使用跨十三种语言和五种脚本的经过验证的并行句子,我们通过共享瓶颈来比较标记、字节和像素,该瓶颈的宽度被扫描以跟踪速率效用边界。这区分了经常被混淆的三个量:编码创建的输入位置的数量、编码后可用的潜在容量以及在压缩中幸存下来的与任务相关的信息。我们评估了三个实用程序:表面形式保留、跨语言句子对齐和主题分类。没有编码在跨任务或能力机制中占主导地位。像素最好地保留表面形式,字节最好地保留跨语言对齐,尤其是在相同脚本的多语言设置中,并且标记最好地支持主题预测。这些性能不能仅用序列长度来解释。短输入可能会丢弃有用的含义,而长输入可以保留压缩良好的信息。因此,选择编码并不是对标记、字节或像素的固定偏好,而是取决于任务、语言组合、容量机制和计算预算的速率-效用权衡。