论文

Transformer 中的有效上下文:碎片化和标记化分析

Effective Context in Transformers: An Analysis of Fragmentation and Tokenization

模型评测模型行为与机制分析

摘要

Transformer 对序列的表示进行预测。相同的数据可以写为字节、字符或子字标记,并且这些表示可能是无损的。然而,在固定的上下文窗口下,它们不需要向模型公开相同的信息。这就提出了一个基本问题:表示的选择如何改变有限上下文预测器可以实现的目标?我们在马尔可夫源上研究这个问题并发现了两个互补的现象。首先,我们观察到,即使上下文窗口扩大到覆盖相关源历史记录,转向较小的表示单元也会损害预测。为了解释这一点,我们引入碎片:一种无损重新编码,用几个较小的单元替换每个源符号。我们证明碎片可以严格增加最优有限上下文对数损失,表明差距不仅仅是优化或容量问题,而且可能是表示的本质。这给出了在字节级和字符级模型(例如 ByT5 和 CANINE)中观察到的相对于子字标记化模型的有限上下文间隙的理论解释。其次,我们研究相反的方向:贪婪标记化——BPE、WordPiece 和相关方法——将源符号分组为更大的单元。我们表明,标记化可以使短标记窗口表现得像更长的源上下文窗口,并且我们给出了损失保证,描述了何时可以实现这一点。保证取决于词元窗口跨越所需源历史的可靠程度,以及词元生成器的压缩率。这也为真正的标记器提供了一个简单的诊断:测量固定标记窗口可靠包含多少源上下文。这两个方向共同建立了一个有限上下文信息理论框架,用于推理 Transformer 中的表示选择。